当AI幻觉开始操作电脑:深大、港科大提出ECA,让Agent行动前先验证证据
当AI幻觉开始操作电脑:深大、港科大提出ECA,让Agent行动前先验证证据让 AI 帮忙发一封邮件,它可能把正文写得妥帖、附件整理得齐全,最后却发错了人。
搜索
让 AI 帮忙发一封邮件,它可能把正文写得妥帖、附件整理得齐全,最后却发错了人。
在 Milvus 里,HNSW 通常用于追求较高 Recall 的向量检索。
浙大与港大团队开源轻量化记忆路由器LayerRecall,通过选择性检索历史记忆并仅注入对长程信息敏感的特定DiT层,解决长视频生成中角色离场再返回时身份与属性丢失的问题,在MemoBench和MovieBench评测中取得Overall第一,且约6.6MB的路由权重可零再训练迁移至其他视频生成骨干。
2025 年 12 月,OpenAI 联合多家实验室发布了一份湿实验室报告。报告给出了一个令人振奋的核心结论:GPT-5 通过多轮迭代,自主优化了一个分子克隆方案,效率提升了 79 倍。它提出了一种此前从未被报道过的酶组合——RecA 重组酶与噬菌体 T4 的 gp32 蛋白协同作用,让 DNA 末端配对效率大幅跃升。
在印度,消费者每天会接到大量电话,从骚扰电话、诈骗电话,到送货员和金融服务公司的联系,种类繁多。虽然有 Truecaller 等应用以及政府的来电姓名显示(CNAP)系统可以识别来电者身份,但仅知道对方姓名往往不够。因此,Equal AI 正在开发一款助手,能够代你接听电话、收集信息,并告知你对方来电的原因。
RAG 系统上线后答案出错,绝大多数团队的第一反应都是换更贵的模型、反复调试 prompt。
如果你这周自己写了求职信,你输给的并不是更好的候选人。你输给了一个更差的候选人,他花了 20 美元给 OpenAI。 今年初,马里兰大学、新加坡国立大学和俄亥俄州立大学的三位研究者从 LiveCare
多模态大推理模型的幻觉,很多时候并非「没看见」,而是在最不确定的推理阶段想偏了。最新研究发现,模型在生成because、however、wait等transition words时,往往处于高熵关键节点,更容易脱离图像证据、转向语言脑补。LEAD在高熵阶段不急于输出单一离散token,而是先在潜在语义空间保留多种候选推理方向,并通过视觉锚点持续拉回图像证据,显著缓解幻觉。
生成式模型当检索器大材小用效果还不好?
Granola 最初是一款面向专业消费者的应用,安装在用户电脑上,用于转录会议并生成笔记。如今,它一直在开发功能以适应企业级技术栈。例如,去年它开始允许团队成员协作处理笔记。公司表示,目前已成功打入 Vanta、Gusto、Thumbtack、Asana、Cursor、Lovable、Decagon 以及 Mistral AI 等企业客户。