研究

来自团队的研究与动态

论文、研究发现,以及Sentinel团队的最新进展。

研究

一套关于数据污染的通用理论,发表于JMLR

我们关于监督学习中数据污染通用理论的论文发表于Journal of Machine Learning Research(JMLR)。这篇文章介绍研究发现。

研究

GateBreaker:我们针对混合专家大模型安全对齐的攻击研究被USENIX Security 2026录用

我们关于攻击混合专家(MoE)大模型安全对齐的论文被USENIX Security 2026录用。这篇文章介绍研究发现。

研究

NeuroStrike:我们针对LLM安全对齐的攻击研究被NDSS 2026录用

我们关于对齐大模型神经元级攻击的论文被NDSS Symposium 2026录用。这篇文章介绍研究发现。

研究

COPA 2024最佳论文:数据污染下的保形预测

我们的获奖论文,研究校准数据被污染时保形预测的表现。这篇文章介绍研究发现。

研究

检验无法给出概率的生成模型,发表于NeurIPS 2022

我们发表于NeurIPS 2022的论文,研究如何检验只能采样、无法给出概率的生成模型。这篇文章介绍研究发现。

研究

我们关于弱监督学习的著作,由MIT Press出版

我们关于弱监督学习的著作由MIT Press出版。这篇文章介绍这本书的内容。

研究

检验模型能否拟合弯曲空间上的数据,发表于ICML 2021

我们发表于ICML 2021的论文,研究弯曲几何空间上模型的拟合优度检验。这篇文章介绍研究发现。

研究

NeurIPS 2017最佳论文:一种时间复杂度线性增长的拟合优度检验

我们发表于NeurIPS 2017的最佳论文,提出一种时间复杂度随样本量线性增长的拟合优度检验。这篇文章介绍研究发现。