|
|
主讲人
刘东瑞,上海人工智能实验室可信安全中心青年科学家,入选上海市东方英才拔尖项目,担任2030人工智能重大专项课题负责人。长期从事安全可信人工智能研究,包括大模型/智能体的安全高效推理、可解释性、攻防、对齐和评测等。负责国际首个诊断式智能体守卫模型AgentDoG研发,SafeWork-R1攻防和安全高效推理后训练,有效减少模型过度思考过程中的安全漏洞,促进安全锚点高频涌现,模型安全水平相对超过 Claude Opus 4和GPT 4.1 5%以上。负责国内首个针对AI灾难性风险技术评测(SafeWork-F1&1.5),获得Anthropic 联合创始人长篇解读。在安全可信领域产出四十多篇高水平会议和期刊论文,包括CVPR 2024 最佳论文候选奖, ACL 2025杰出论文奖, CVPR Oral, ICLR Oral, AAAI Oral和多篇ACL Oral等。
技术讲座请看McSafe的B站链接:扼守风险:从大模型到智能体安全_哔哩哔哩_bilibili
|
|