AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8
AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。
搜索
Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。
OpenAI与AWS联合测试显示,GPT-5.6 Terra在AWS Kiro平台上完成单次任务成本下降约82%,远超其官方20%的降价幅度,差额主要来自智能体框架与编排系统的效率优化,标志着GPT-5.6在AWS开发平台上与Claude展开直接竞争。
OpenAI内部代号mozaik-alpha-fdm的Astra模型扩大灰度测试,其在Max effort模式下展现的零样本前端与3D网页一次生成能力引发开发者惊叹,预计9月3日前后正式发布以正面硬刚Anthropic的Fable 5.1。
Perplexity推出本地优先智能体Portable Computer,通过专为端侧模型设计的Harness配合Qwen3.8-27B实现近零成本的本地推理,并在多项基准测试中超越Hermes和Pi等开源通用框架。
Accelerated Understanding由英伟达前AI研究总监Anima Anandkumar联合创立,采用神经算子架构构建支持5万亿推理上下文的物理AI大模型,可一次推演完整4D时空轨迹,其创始人拒绝贝索斯35%股权及超20亿美元融资的普罗米修斯计划招揽。
OpenAI于8月26日向所有免费用户开放ChatGPT侧栏的定时任务功能,使其覆盖9亿周活用户中的九成以上,免费版可设3个任务并支持一次性提醒、周期性任务和监测型任务三类场景,同期仅为Plus及以上付费用户上线接入Gmail、Slack和GitHub的事件触发能力。
Claude Code内置的安全降级机制严重翻车,开发者在使用AI编程工具Fable 5编写临时文件清理脚本时触发对抗性审查,模型被先后从Fable 5降级至Opus 5再到Opus 4.8,最终因变量复用错误导致Opus 4.8误删开发者Guillemot的整个主目录,700GB数据丢失。
OpenAI这次官宣「零留存」新招,剑指Anthropic两个月前刚给企业客户立下一条规矩:想用最强的那档模型,先交出30天数据。第二天,Anthropic就松了口:数据虽然仍要留30天,但可以留在客户自家的云上。
FDE 是什么,这个最近在硅谷走红的岗位,怎么就突然成了 AI 公司招聘页面的热门。Forward Deployed Engineer 是 FDE 的全称,常译作前沿部署工程师或前线部署工程师。这类工程师既要写生产代码,也要懂 Agent、评测和安全;既要进入客户现场,又要决定什么问题值得解决。
Anthropic正式宣布:Claude Chat和云端Claude Cowork,从今天起共用同一套记忆。Claude记忆从此无处不在,而且,你能决定它记住什么。Claude Code之父Boris Cherny转发了这条公告,称它是一个小改进:记忆现在更简单也更强了。