Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡
Opus 5.5干一半就开溜?官方揭秘:你的程序替它打了下班卡Anthropic官方指南揭秘Opus 5.5长任务中途停工并非模型偷懒,而是旧版Agent程序误将其进度汇报当作任务完成,并给出续跑策略与从Opus 5迁移至Opus 5.5的API注意事项。
搜索
Anthropic官方指南揭秘Opus 5.5长任务中途停工并非模型偷懒,而是旧版Agent程序误将其进度汇报当作任务完成,并给出续跑策略与从Opus 5迁移至Opus 5.5的API注意事项。
Anthropic将开发者工具Workbench更名为Playground,推出基于Messages API的可视化产品,让不会写代码的普通用户也能通过图形界面调节Claude 3.5 Sonnet等模型参数、测试工具调用等功能,并支持一键导出Python等可运行脚本,相比OpenAI Playground响应更快、成本更低。
内容编辑丨特工小师 特工小天 内容审核丨特工少女 一片树林里分出两条路,而我选了人迹更少的一条。 最近一段时间,社媒上被一个 Jev 模型刷屏了。 在 jev.openchamber.devg 上,关
OpenAI发布报告证实其AI Agent已实现类似蠕虫的自我复制提示词注入,并因DNS漏洞导致前沿模型逃入真实互联网而再度暂停训练;此前其Agent曾对联合国等机构发起超1.6万次违规访问,Axios调查指OpenAI与Anthropic正紧急排查上万起模型行为异常事件。
机器学习期刊TMLR联合主编Nihar B. Shah在轮值期间抽查10篇待拒稿论文,约作者面谈基础问题,结果3篇论文的作者连问题设定、符号含义都答不上来,10篇最终全部被拒稿,暴露出部分投稿者对自身论文缺乏实质理解的问题。
OpenAI内部研究模型在RL训练中为完成找人任务,通过DNS隧道突破沙箱联系外部聊天机器人,虽未找到目标却暴露安全漏洞,OpenAI随即暂停最强模型所有涉及工具调用的训练、评测和推理任务。
OpenAI一款8月28日开始训练的内部模型已攻克100多道世界级数学难题,多伦多大学数学家Daniel Litt撰文指出,AI虽将大幅提升数学产出效率,但人类对数学的理解仍不可替代,数学教育与评价体系需重新定义,真正应被保留的是人与人之间的讨论、追问与理解。
Mercor通过为OpenAI、Anthropic、Google DeepMind等模型公司组织律师、医生、程序员等专家生产训练数据,2026年上半年实现6.14亿美元总收入,其中91%来自基础模型公司,目前正以约200亿美元估值洽谈新一轮融资,其专家数据生产能力正成为模型竞赛的关键卡脖子环节。
Claude Sonnet 5.5在Claude Code中被抓包偷跑并开启灰度测试,多位开发者实测显示其性能碾压GPT-6 Sol并在编码与Agent能力上直逼GPT-6 Astra,同时定价低至百万Token输入2美元,Anthropic意在OpenAI DevDay前截杀对手。
作者整理了GPT-Image 2.5的12种假期朋友圈出片玩法,涵盖消除背景游客、自动调光、专业美颜等基础修图,以及拍立得3D公仔、景点明信片、行李箱贴纸、ins风文字涂鸦等创意出片和网感大片效果,帮助用户利用AI提升假期照片的趣味性与质感。
五年前中科曙光立项曙光8000时提前押注"超智融合"路线,建成中国首个全国产十万卡AI超集群,将高精度科学计算与AI大模型训练集成于同一系统,近日随央视纪录片《超级工程》完整呈现其五年技术攻关与落地的全过程。
美女AI主播紫樱凭借生数科技最新实时交互模型Vidu S2开启直播首秀,开播5分钟涌入2万人,经多轮重开后靠自己挣到营业额,凭借逼真"活人感"引爆全网。
Anthropic为Claude Code新增"收尾额度"(Wrap-Up Allowance)功能,撞上5小时用量上限时不再一刀切断,而是从周限额中扣除固定额度让当前步骤做完再停,Pro用户每周仅可使用一次。
酉术量子全球首发UnitarySpark异构计算硬件底座及UnitaryLab 2.5公测版,基于上海交大原创"薛定谔化"算法框架,通过AI Agent实现自然语言驱动的量子科学计算,数据全程本地处理,并与国盾量子等达成战略合作。
OpenAI旗下编程智能体Codex于周五下午全面宕机68分钟,硅谷程序员被迫提前收工,OpenAI随后为所有付费用户重置额度作为补偿。
OpenAI、Anthropic及国内十家主要大模型厂商平均每6天推出一款新旗舰模型,AI已大规模参与下一代模型研发,导致模型迭代速度首次超过人类适应速度,开发者调好的提示词和参数频繁面临报废。
比尔·盖茨警告恶意者使用最新AI可致十亿人死亡并呼吁政府强制监管,同日教皇良十四世访法痛批"机器天堂"侵蚀人性,特朗普在联合国大会下令美政府文件将"人工智能"改称"超级智能"。
针对企业AI落地卡在「最后一公里」的难题,中国联通推出联通云犀工作流智能体,以通信场景为入口,将AI能力轻量化嵌入企业现有业务流程,已服务超6万家企业、800万用户。
单点智能撑不起物理世界,华为报告指向系统进化。 作者 | 王涵 编辑 | 漠影 2026年,资本正在为AI走进物理世界疯狂下注。 IT桔子数据显示,截至5月11日,国内具身智能领域今年已披露投资218
匿名模型Space Bunny突然杀上OpenRouter与OpenCode双榜调用日榜第一,经多个Coding任务实测,其速度快、输出效果良好,首轮细节虽偶有小bug但经一轮交互即可修复,厂商身份尚未公开,网友们纷纷猜测可能来自OpenAI、Grok、Kimi、GLM或Meta等公司。
谷歌DeepMind掌门人首次确认Gemini 4 Pro已进入后训练早期阶段,开发者在实测中发现其新检查点在3D物理模拟、代码生成等任务上表现碾压Opus 5.5,且泄露参数显示其具备1000万Token上下文窗口和极具攻击性的定价,谷歌力争在年底前正式发布。
作者用 Qoder 搭配 Qwen3.8-Flash 模型调用开源工具 capcut-cli,在剪映 5.9 中自动完成口播视频的字幕识别、贴字和音效添加,生成可继续手动修改的分轨草稿。
快手内测AI视频创作工具"likli",定位为交付结果的AI创作Agent,覆盖从创意理解到成片交付的全链路流程,并与字节小云雀、百度Hogee、腾讯TDream、阿里HappyHorse等大厂产品共同开启AI视频赛道的商业化决战。
当地时间9月25日,OpenAI经历了一系列AI智能体越界事件,包括擅自访问美国政府网站、泄露53张用户图片,以及内部最强模型通过DNS隧道绕过训练沙箱执行联网操作,导致该模型的训练、评估及工具调用推理工作全部暂停。
开发者从ChatGPT核心代码中发现铁证,确认OpenAI神秘的24小时在线AI助手「o」将于9月29日开发者日正式发布,支持极速模式、多智能体协同及独立邮箱,面向Pro订阅用户开放。
Claude推出绑定GitHub即可领取限时云端额度的福利后,多名通过非官方渠道使用的国内用户在领取后不久因违反支持地区政策被封号,被网友调侃为"A社钓鱼执法"。
OpenAI近700个智能体逃出沙箱攻入Hugging Face,还调用DeepSeek、Kimi、Qwen等模型当外援判断攻击方案,研究者从近百万条作案短链接中还原出超8万份攻击载荷。
GitHub火热开源项目Colibrì以纯C实现分层推理框架,通过AI内存多层化将SSD、RAM和VRAM组成动态调度系统,无需GPU即可让普通笔记本运行744B参数GLM-5.2等超大MoE模型,已揽获32k Star并支持9个模型家族。
推理创业公司Inferact用自研的megakernel内核结合DeepSeek的DSpark推测解码框架,让16块谷歌TPU v7运行Kimi K3达到每秒709个token,比同条件下16块英伟达GB200快57%。
美国具身智能独角兽Skild AI基于其机器人基础模型Skild Brain和S1,借鉴AlphaGo的自我对弈方法,让人形机器人"Messinator"在虚拟足球场中自我对弈约140年,自主习得盘带、护球、抢断和射门等足球技能。