多模态 Agent 记忆,为什么不能当成升级版多模态RAG?
多模态 Agent 记忆,为什么不能当成升级版多模态RAG?多模态 Agent 的记忆系统,过去很容易被理解成一个升级版 RAG:图片、图表、PDF 进来之后,先抽取内容、做 embedding、写进向量库;用户提问时,再用 query 做检索,把命中的top-k图片、文档页或图表一并塞进上下文,再交给多模态模型回答。整个过程中,所有原始模态信息都会不加选择的塞给大模型。
搜索
多模态 Agent 的记忆系统,过去很容易被理解成一个升级版 RAG:图片、图表、PDF 进来之后,先抽取内容、做 embedding、写进向量库;用户提问时,再用 query 做检索,把命中的top-k图片、文档页或图表一并塞进上下文,再交给多模态模型回答。整个过程中,所有原始模态信息都会不加选择的塞给大模型。
现在,我依然会使用AI,但是我不再把AI的产出当成最终答案。AI可以帮我提高效率,却不能替我承担结果。它写错一个字、弄错一条信息,最后向客户解释的是我,被领导追责的也是我。该自己做的判断,一个都不能省。
葬AI身边的朋友常常有个疑问:为什么MiniMax M3做的不够好(问了很多在做模型测评的朋友,也是类似看法),但市场仍然觉得他们是第一梯队?我朋友@朱亦辉的解释是,MiniMax M3的核心科技是叙事能力,让外界觉得他们和Kimi是一个级别,达到一个强行双骄的效果。
最新世界模型 LingBot-World 2.0 正在试图实现的事情。「一个世界只需要几秒钟就能造出来」不再仅限于预制的世界,而是让每一次生成,都是一次全新的创造。这是一个秒级生成、支持实时交互的开源世界模型。
我最近又玩了一个新的视频制作平台,名叫 Flova,它的思路就是我上边说的这个方向。它不仅仅是一个调用单个模型的生成工具,而是一个面向 AI 视频 / AI 影视创作的全能六边形 Agent。
前言 好久没有给大家整理开源工具了,最近我又翻到几个挺有意思的 AI 项目~ 今天这篇不是很重的教程,每个项目我都简单说一下它是干嘛的、适合谁、我觉得值得看的一点。 感兴趣的小伙伴可以先收藏,后面真用
从ChatGPT掀起生成式AI浪潮到现在,不过短短两三年,AI能力的进化速度已经让"AI自我进化"这件事从科幻走进了现实。上个月,Anthropic在一份公开报告中预测,AI未来将进入"递归自我提升"(Recursive Self-Improvement, RSI)阶段,并呼吁人类共同为AI的发展设计出一个减速或暂停机制。
AI 行业尤其明显。Founder、产品经理、独立开发者都得有公众号/小红书/X 三件套(可能还要加一个即刻)。连平时不爱说话的 i 人,也要在朋友圈里输出几句“行业观察”。表达变多当然是好事,但话说多了,翻车概率也会跟着上来。
我天天在ai news radar里刷呀刷,真刷出了个新的开源项目,Tutti。光看Readme的时候,我以为它又是一套给Agent套GUI的桌面壳,实际上它提供了一个实时共享的工作空间,我所有agent可以共享上下文,文件,应用和任务。
这个 JavaScript 运行时原本拥有 535,496 行 Zig 代码,不包括注释;同时,约 20% 的代码由 C++ 编写,并嵌入了多个 C/C++ 库。此次借助 AI 重写为 Rust,整个过程涉及超过 100 万行代码变更、6778 次提交,并在 Claude Code 中运行了大约 50 个动态工作流(dynamic workflows)。