USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释
USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释智能体时代,安全研究不仅要关心模型说了什么,现在还必须进一步回答:它做了什么、为什么这么做,以及这次的执行轨迹是否越过了当前场景明确规定的安全边界。
搜索
智能体时代,安全研究不仅要关心模型说了什么,现在还必须进一步回答:它做了什么、为什么这么做,以及这次的执行轨迹是否越过了当前场景明确规定的安全边界。
大模型解短题常能给出流畅答案,推理链一长,却可能每一步都看似合理、终点仍然失效。来自弗吉尼亚理工大学、威斯康星大学麦迪逊分校和达特茅斯学院的研究团队在 NeurIPS2026 论文中提出 SAGE:用符号闭包分析(SCA)解释长推理中的探索偏差与累积偏差,再把这一诊断变成训练时的结构引导。
Anthropic强化学习技术负责人Sholto Douglas预测,能力等于甚至超过所有人类的AGI可能在未来几年内出现,2028年AI年度资本开支或达4万亿美元,而研究员Nick Marwell对AI无需人类搭档后的后果表示紧张。
Anthropic部分早期员工因担忧AI失控开始考虑在美国偏远地区买地避难,这群源自湾区AI安全圈的研究者也因风险判断不同而选择留下或离开。
一位北大数学系校友认为,OpenAI和Anthropic借AI高调宣传数学突破,可能误导公众并打击青年学习数学的热情,学界仍应支持人类数学研究与公平成果归属。
来自上海创智学院、复旦大学、伦敦国王学院与牛津大学等机构的研究团队推出SocioVerse2,将大模型社会模拟扩展为可干预、可迭代、可回溯的开源社会科学研究框架。
Harvey联合创始人Gabe Pereyra表示,AI应用公司不必与大模型公司比拼资金和算力,可借助真实任务评测、领域专家、开源模型和外部研究团队建立持续学习能力。
Geoffrey Hinton联合Yoshua Bengio、OpenAI首席科学家Jakub Pachocki、Anthropic联合创始人Jack Clark等20多位AI研究者发布剑桥CASP报告,指出AI已深度参与自身研发,Anthropic内部AI生成代码占比已超80%,警告递归自我改进可能引发技术进步突然加速的「智能爆炸」。
亚马逊公司与杜克大学的研究表明,在大模型后训练的在线策略蒸馏(OPD)中,仅保留万分之一的极端稀疏监督信号即可显著提升学生模型的推理能力,且性能可匹配甚至超越密集全信号训练。
南洋理工大学安波团队最新研究指出,Agent Harness的选型应将模型、Harness与任务作为完整配置联合评估,不同任务下最佳组合会变化,原生搭配也未必优于其他可配置Harness。