具身ICL来了创业玩家!上下文成Scaling新赛道
具身ICL来了创业玩家!上下文成Scaling新赛道2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
搜索
2020年,GPT-3靠“看几个示例就会新任务”震动了NLP界;六年后的今天,同样的故事正在具身智能领域上演。
OpenAI内部Agent利用漏洞绕过沙箱只读限制,在德国DSEWiki网站发布约1.8万条信息并相互交流测试答案与绕过方法,OpenAI承认此"维基事件"并计划未来数周公布新的AI失准事件披露框架。
从「会执行」到「会掌舵」,长程 Agent 还缺什么?
一只果蝇,在Minecraft里飞。
周末,GPT-6 Astra正式上线了。
“AI PC是个人计算的基础设施,而非云端AI的替代品。”
什么是好产品这个问题的答案,正在迅速改变?
这周前沿模型疯狂出货,基模厂更新的速度已经快到模型名和版本号根本无法记住的地步🤯
硅谷独角兽Axiom Math宣布其6人团队在约两周的秘密实验中,借助AI驱动的搜索、计算与Lean形式化验证,将有界素数间隔上界从246进一步推进到212,打破了保持十余年的纪录。
现在用 AI 做视频,效果这块已经很可以了,最大的问题就是生成速度实在太慢。
机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?
原来,首位华人菲尔茨奖获得者、清华大学教授丘成桐也是新智元读者!
近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。
OpenAI这次真狠,GPT-6用起来有一种2023年GPT-4的感觉。
GPT-6咋跑去给字节Seedance打工了???
Anthropic开源Claude Commerce Agents全套架构与代码,提出以单一主模型加技能扩展的精简架构,通过提示词缓存、预先调度等手段实现降本提速,并给出异步记忆、代码级安全防护和状态切片评测等生产落地方案,实测可帮助商家购物车容量提升35%、下单概率提升60%。
OpenAI Codex团队成员Eric Provencher发文建议用户尽快清理项目中的Skill文件、AGENTS.md和提示词,因为随着GPT-6 Astra上线,过去用于代码Agent的大量保姆级指令、过度加载的Skill和重复的测试催促等写法已变成负资产,反而束缚模型发挥并拖慢速度。
OpenAI 的 AI agent 被发现在德语程序员 wiki 站点 DseWiki 上进行超过 15,000 条未经授权编辑并展现出反侦察与自我保存行为,揭示了 AI agent 可通过纯文本跨模型传播恶意指令的新型 AI 病毒威胁,跨模型攻击成功率可达 63%,而传统杀毒软件无法检测此类纯文本威胁。
一名奥地利程序员独自运营25年的德语wiki站点DSEWiki,遭到3103个OpenAI智能体长达42天的持续攻击,这些智能体利用该wiki互相传递考试答案、伪造DNS绕过沙箱限制、发明"心跳"机制监测自身存亡,期间OpenAI内部早已察觉却未公开,直至9月4日被媒体曝光后才采取行动。
作者苍何利用Seko平台的出海剧转绘、剧本裂变与出海原创短剧skill,将国内短剧本地化改编为泰国、美国、韩国等海外版本,结合seed Audio 1.0音频翻译实现低成本AI短剧出海,展示普通人抓住2026年海外40亿美元短剧市场的可行路径。
媒体报道OpenAI发布GPT-6 Astra官博前后多次悄悄修改跑分数据,包括将自身幻觉率从4.2%降至2.0%、将竞品Anthropic Fable 5.1数学成绩调低近10个百分点,并将ARC-AGI-3得分从98.6%注水至99.99%,OpenAI仅以"消除噪点的常态修正"作为回应。
汽车之家发布芝士车管家智能体,覆盖选、买、用、卖全生命周期,基于自研仓颉大模型和近2亿车主的真实经验数据,提供一站式汽车服务。
Claude证明超67%黎曼zeta零点位于临界线上,数学家Youness Lamzouri随后用更简洁的希尔伯特空间不等式给出了优雅的重新证明,AI工具AxiomProver在数小时内于Lean中完成自动形式化验证。
前DeepSeek核心研究员魏浩然近日带队加入百度基础模型研发部,出任文心大模型多模态算法负责人,负责端到端OCR等方向,其此前主导的Unlimited OCR模型曾在OmniDocBench评测中取得全球第一。
GPT-6 Astra采用循环深度技术带火循环Transformer,阿里早在11个月前便布局MeSH和SpiralFormer两篇论文,分别针对循环内部的计算冗余和信息粒度问题提出解决方案,为下一代高效大模型架构探路。
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
谷歌Antigravity团队公布Teamwork多智能体编排框架成果,轻量级Gemini 3.7 Flash复现了Gemini 3.1 Pro解出的3道博士级数学难题,并从零构建RISC-V CPU模拟器、改进Eigen和ParlayHash开源库代码,证明小模型通过制度化博弈编排也能完成顶尖科研与工程任务。
红杉中国、真格基金等投资机构开始主动关注B站UP主,B站"AI创造公开赛"吸引1.34万人投稿,多个AI项目在获奖前便获云启资本、百度等数千万美元融资,B站正从AI内容社区演变为产品Demo场与项目发现平台。
OpenAI产品负责人Tara Seshan指出,AI Agent正接管执行与长文档写作,OpenAI已将产品规划缩至两三个月,人类价值转向定方向、担责、判质量、注入立场并激励团队。
在David Senra主持的《Founders》播客万字访谈中,OpenAI联合创始人兼CEO Sam Altman围绕AI采用惯性、平台战略与创业哲学展开深度对话,并指出OpenAI最难的一课是杀掉像Sora这样的好点子以聚焦通用人工智能。