AI资讯新闻榜单内容搜索-Claude

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Claude
刚刚,Claude首次形式化证明费马大定理!清华姚班大神出手了

刚刚,Claude首次形式化证明费马大定理!清华姚班大神出手了

刚刚,Claude首次形式化证明费马大定理!清华姚班大神出手了

清华姚班出身的彭天翼带队,Anthropic旗下Claude仅用11天、消耗60亿Token和1300万行代码,首次端到端形式化证明了困扰数学界350年的费马大定理,并产出29500条可验证中间定理,成为迄今为止最大的Lean证明。

来自主题: AI资讯
8002 点击    2026-09-05 10:52
Manus团队测模型一点微小的经验

Manus团队测模型一点微小的经验

Manus团队测模型一点微小的经验

Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。

来自主题: AI资讯
8815 点击    2026-09-05 10:46
刚刚,Claude完成费马大定理首个完整形式化证明

刚刚,Claude完成费马大定理首个完整形式化证明

刚刚,Claude完成费马大定理首个完整形式化证明

Anthropic声称其模型Claude在11天内完成了费马大定理的完整形式化证明,写下约1300万行Lean代码,人类仅提供少量高层指导,其中30300个定理获得机器可验证证明,标志着大规模自动形式化首次接近工程化落地。

来自主题: AI资讯
8964 点击    2026-09-05 09:18
CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。

来自主题: AI技术研报
7672 点击    2026-09-04 15:51
刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

刚刚,Anthropic公布Fable 5.1保姆级使用技巧,看完少走十天弯路

Anthropic发布Fable 5.1完整提示词与工程落地指南,涵盖思考档位选择、工具调用进度汇报、历史对话管理、上下文压缩、写作密度控制、检索引用规范、安全策略调优、多智能体并行及视觉任务处理等多方面的使用技巧与避坑要点。

来自主题: AI资讯
10327 点击    2026-09-04 00:02
全网实测开玩Fable 5.1,听说写作说话和真人没区别?

全网实测开玩Fable 5.1,听说写作说话和真人没区别?

全网实测开玩Fable 5.1,听说写作说话和真人没区别?

Anthropic前脚刚发布了Fable 5.1(具体可见Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线),后脚第三方权威跑分和个人第一手实测已经出炉了!

来自主题: AI产品测评
8226 点击    2026-09-03 10:08
让AI长出“科研大脑”,Inherent获5000万美元种子融资|AlphaFounders

让AI长出“科研大脑”,Inherent获5000万美元种子融资|AlphaFounders

让AI长出“科研大脑”,Inherent获5000万美元种子融资|AlphaFounders

前DeepMind AI Scientist团队创立的Inherent获5000万美元种子融资,其基于Qwen3.6-27B后训练的科研判断系统Faraday在AI for Science预留测试集上以0.791的平均得分超越Claude Opus 4.8与GPT-5.5 Codex。

来自主题: AI资讯
8968 点击    2026-09-03 10:03
Scaling 的不只是模型:EvoX 想做下一个入口

Scaling 的不只是模型:EvoX 想做下一个入口

Scaling 的不只是模型:EvoX 想做下一个入口

EvoMap团队推出自进化智能体EvoX,采用无中心调度的蜂群模式让大量Agent平级协作、自主组队,在563道逻辑、数学、物理题上将Claude Haiku 4.5的正确率从单Agent的26.29%提升至70%以上,并开源AutoResearch项目构建Agent经验基础设施。

来自主题: AI资讯
9633 点击    2026-09-02 16:18
刚刚,A社自曝「最坏Claude」!150人紧急转岗,新品开发全停

刚刚,A社自曝「最坏Claude」!150人紧急转岗,新品开发全停

刚刚,A社自曝「最坏Claude」!150人紧急转岗,新品开发全停

就在最近,Anthropic突然爆料了一个被自己故意「训坏」的Opus级模型!挑80个有毛病的训练环境,把模型丢进去,撤掉所有纠偏机制,然后看它长成什么样。

来自主题: AI资讯
8213 点击    2026-09-02 15:03
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。

来自主题: AI技术研报
8356 点击    2026-09-02 14:33