随着学术文献数量持续增长,高质量学术综述已经成为研究者快速进入陌生领域、梳理研究脉络和追踪最新进展的重要入口。但真正写好一篇综述并不容易:它通常需要阅读大量文献、持续跟进领域动态,并投入大量专家时间。
大模型的出现,让这件事开始有了新的可能。近年来,Deep Research 和自动 Survey Generation 系统已经能够完成论文检索、资料整理、分析与长文本生成,甚至快速产出数万字的 Research Report。
但如果真正对照一篇高质量的 Academic Survey,问题就复杂得多。
论文该怎么组织?Taxonomy 怎么划分?不同论文应该放到哪些 Section?一个 Claim 到底应该由哪些 Citation 支撑?写完之后,References、Cross-reference、Figure、Table 和最终 PDF 又是否真的可靠?
这些问题,并不是简单拉长上下文、生成更多文字、引用更多论文就能解决的。现有 Deep Research 和自动 Survey Generation 系统,很多时候仍主要围绕 “检索 — 分析 — 写作” 展开,最终结果也更接近一份 Research Report,而不是一篇结构完整、组织严谨的 Academic Survey。
针对这些问题,浙江大学、上海交通大学团队及其合作者提出 Deep Academic Survey(DAS),尝试让 AI 在 1 小时内自动完成一篇面向发表的 Academic Survey。
不同于传统的「检索 — 写作」流水线,DAS 采用 Stateful Agentic Framework,将整个过程重新定义为 Stateful Agentic Closed-Loop Manuscript Construction。

图 1|现有 Deep Research 和自动综述生成系统与 DAS 对比图
在 DAS-Bench 的 30 个 Survey Topic 上,DAS 从 Citation、Taxonomy、Discourse 和 Manuscript Reliability 四个核心维度进行评测,最终平均得分达到 4.34,完整参与 30 个 Topic 的最强基线为 4.03。在专家匿名评测中,DAS 相比 Naive RAG 在 27/30 个 Topic 上更受偏好,相比 AutoSurvey 则在 19/21 个共享 CS Topic 上更受偏好。
目前,项目网站已经直接开放了 220 篇 DAS 自动生成的热门方向 Survey,完整结果和不同方法的对比都可以在线查看。

面对近 200 万篇论文,
DAS 先解决的不是「写」,而是「读懂」
DAS 的后续检索、组织和写作,都建立在一个底层文献基础设施之上 ——DAS-2M Literature Metadata Lake。
团队对 2020 年 1 月以来近 200 万篇 arXiv 论文进行全文解析,并利用 LLM 提取面向 Survey Writing 的结构化 Metadata,包括方法、数据集、实验结果、创新点和局限性等信息,目前 DAS-2M 已完整开源至 Hugging Face。相比只依赖 Title 和 Abstract,这相当于提前对大规模论文进行更细粒度的「预理解」:一篇论文只需解析一次,便可以被不同 Survey Topic 重复利用;同时,DAS-2M 也是一个持续动态更新的 Literature Metadata Lake,随着新的 arXiv 论文发布,系统会通过同一套解析与 Metadata 提取流程不断补充最新文献,使 DAS 在生成新的 Survey 时能够持续跟进领域进展。
在此基础上,DAS 建立 lexical 和 semantic 索引。用户输入 Topic 后,系统先从 DAS-2M 中检索出全局候选文献,再基于这些候选论文构建 Candidate-Grounded Taxonomy,并通过 Reverse Paper-to-Section Routing 判断每篇论文应该支持哪些 Section。
这样,DAS 后续的 Taxonomy、Paper Assignment、Paragraph Planning 和 Citation Planning,都不再建立在零散检索结果上,而是共享同一套可复用的文献表示和候选集合。
从组织到写作,
DAS 如何形成 Agentic Closed Loop?
DAS 的核心并不是简单串联多个 Agent,而是维护一个持续更新的 Manuscript State:候选文献决定 Taxonomy,Taxonomy 和 Routing 进一步约束写作,而 Review 发现的问题又可以重新激活对应的 Writing State。整个 Survey 的构建过程因此不再是一次性的流水线,而是一个可以持续更新和回退的 Stateful Agentic Process。

图 2|DAS 整体框架。
在真正生成正文之前,DAS 还会继续进行分层规划:Taxonomy → Paragraph Plan → Writing Points → Claim → Citation Group。
也就是说,Citation 并不是正文写完之后再补,而是在 Claim-Level Planning 阶段就确定「什么 Claim 应该由哪些论文支撑」,再据此完成 Paragraph Drafting。
写完也并不意味着结束。Semantic Reviewer 会检查章节目标、论述逻辑和 Citation Support;如果发现问题,系统会根据问题范围执行 Direct Edit、Paragraph Replan 或 Section Replan,并再次进入 Review。与此同时,Deterministic Validation 负责检查 Citation Identifier、Cross-reference、LaTeX 和 Compilation 等确定性约束,由此形成:Generation → Review → Repair → Re-evaluation的闭环。
最终,通过 Review 的内容才会进入 Manuscript Finalization,由系统进一步完成 Figure、Table、Bibliography、Cross-reference 和 LaTeX Assembly,并编译得到完整 Survey PDF。
这也是 DAS 所强调的「面向发表」:目标不只是写出一篇足够长的文本,而是尽可能保证从文献组织、Claim/Citation Planning,一直到 References、图表和最终 Manuscript 的一致性与可靠性。
效果到底怎么样?
220 篇完整 Survey 已经可以直接查看
当然,对于一个 Survey Generation 系统,只看 Benchmark 分数还不够,最后还是要看真正生成出来的论文。
目前 DAS 官网已经开放了 220 篇热门研究方向的完整 Survey,同时还提供 Codex、GPT Deep Research、AutoSurvey、InteractiveSurvey 等方法的生成结果,可以直接横向比较。论文中的定性比较也显示,不同系统在 Citation Stacking、粗粒度 Attribution、重复结构以及 Figure 与正文耦合等方面存在明显差异。

图 3|Codex、GPT Deep Research、AutoSurvey、InteractiveSurvey 与 DAS 的完整 Survey 定性比较。

图 4|DAS 官网目前已经开放 220 篇热门 Topic 的完整生成结果。
生成效果究竟怎么样,与其只看一个 Benchmark 分数,不如直接打开一篇看看。
AI 距离真正「写完一篇 Survey」,还有多远?
当然,面向发表并不意味着可以直接替代研究者完成最终投稿。DAS 生成的 Survey 仍需要人工核验;与此同时,Academic Survey Evaluation 本身也仍是一个开放问题,不同 Judge 在细粒度评价上依然可能存在差异。论文中的 Cross-Judge Evaluation 也观察到了这一现象。
随着 DAS-2M 持续更新,未来还可以进一步探索动态文献追踪、人机协同修改,以及可维护、可持续更新的 Agentic Academic Survey Construction。
DAS 希望探索的最终问题并不是「AI 能不能一次写出一篇很长的文章」,而是:
面对不断增长的学术文献,AI 能否通过可追溯、可修正的 Stateful Agentic Closed Loop,帮助研究者更快进入陌生领域,并持续组织和理解不断演化的学术知识?
作者介绍
论文共同第一作者为浙江大学 APRIL 实验室博士生徐志凯、薛竹村,通讯作者为浙江大学百人计划研究员张江宁。
文章来自于微信公众号 “机器之心”,作者 “机器之心”
【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。
项目地址:GitHub:https://github.com/camel-ai/owl
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI