在计算历史的绝大部分时间里,编程的本质是一项翻译工作:开发者需要在人类理解的维度上剖析问题,设计抽象方案,随后将其转译为机器能够执行的语法。当前的软件工程领域正在经历自高级编程语言问世以来最为显著的变化。开发者与机器交互的首要界面,正在从繁琐的语法(大括号、分号、类型注解)向“意图(Intent)”过渡。
谷歌在这份发布于2026年5月的白皮书《伴随“氛围编程”的新一代软件开发生命周期 (The New SDLC With Vibe Coding)》中指出,截至2026年初,已有85%的专业开发者定期使用AI编程智能体,51%的开发者每天使用,预估所有新代码中有41%是由AI生成的。

这一技术演进包含五个明确的历史阶段: 自动补全 (Autocomplete, 约2021年)、内联代码建议 (Inline Code Suggestions, 约2022年) 、基于聊天的生成 (Chat-Based Generation, 约2023年) 、编程智能体 (Coding Agents, 约2024-2025年) 、自主智能体 (Autonomous Agents, 约2025-2026年) 。

在2026年,还想继续用AI提效就必须换掉旧的干活方式。本文将全面拆解谷歌这份51页的白皮书,带你从战略视角看透2026年的Agent生产力如何被定义,以及Context Engineering、Skills与Harness三大基建的核心概念与作用。
2025年2月,Andrej Karpathy提出了“氛围编程 (Vibe Coding)”的概念,描述了一种开发者完全依赖自然语言描述需求,接受AI输出,并在出错时直接将错误信息复制回提示词以求修复的开发模式。该词汇在工程界引发了广泛共鸣,但也造成了术语定义的模糊。
研究者认为,不应将“氛围编程”与严谨的开发模式对立,而应将其视为一条连续光谱的两端。区分这条光谱位置的核心指标,是围绕AI输出所建立的结构、验证机制以及人类判断的介入程度。
光谱的三个基准点特征如下:

这两端的单一最大差异在于输出的验证方式。在智能体工程中,验证由两部分组成:测试(Tests)用于验证确定性系统(输入A产生输出B);评估(Evals)用于验证非确定性部分(智能体是否采取了正确的步骤轨迹、调用了正确的工具并达到了质量标准)。若缺失这两种验证机制,无论提示词多么复杂,该流程在工程定义上仍属于氛围编程。
随着大语言模型的工程化应用深入,提示词工程的边际效益正在递减。研究者指出,AI生成代码的质量不再取决于你用了多么巧妙的提示词,而是取决于你为AI提供了多少丰富、结构化的代码库信息和意图,这就引出了上下文工程 (Context Engineering)。
为了让模型产生确定性的输出,开发者必须在系统中构建和维护六类上下文:

在架构设计中,最大的技术挑战是如何在令牌 (Token) 预算限制下分配这些上下文。研究者将其划分为静态上下文与动态上下文:
为了解决长文本带来的“上下文腐烂”问题,行业内目前广泛采用的架构模式是“智能体技能 (Agent Skills)”。这种模式允许智能体保持为一个轻量级的通用路由节点,仅在任务匹配时,才将特定的程序化知识加载进上下文。通过这种渐进式披露 (Progressive disclosure) 机制,一个智能体可以挂载数十种专业能力,而每次仅消耗当前执行所需的令牌费用。
传统的迭代式SDLC(如敏捷开发)将部署变成了持续的过程,但反馈循环仍受限于人类的编码速度。研究者指出,AI驱动的SDLC极大地压缩了开发周期(从数周缩短至几分钟到几小时),但各阶段的瓶颈发生了重分配。

为了适应新的SDLC,研究者提出了“工厂模型 (The Factory Model)”的系统抽象。在这个模型中,人类开发者的直接产出物不再是代码文件,而是“能够生产代码的系统”。开发者充当工厂经理,负责设计流水线并制定验收标准,智能体则作为流水线上的机器进行生产。
这台“机器”的内部构造是什么?研究者抛出了一个关键的技术论断:基础大模型 (Model) 仅仅是工厂底板上的裸擎,它本身并不是一个智能体。将其转化为具备生产力的智能体的,是环绕在模型周围的代码和基础设施,即“外壳 (Harness)”。
一个生产级智能体的构成公式是:智能体 = 模型 (约占10%) + 外壳 (约占90%)。

外壳 (Harness) 具体包含以下六个技术维度的物理实现:
外壳配置的质量直接决定了系统的性能基线。研究者引用了公开基准测试的工程案例:在Terminal Bench 2.0评测中,一支工程团队在完全不更换底层基础模型的前提下,仅仅通过重构智能体的外壳代码,就将系统的排名从30名开外提升至前5名。另一项LangChain的研究显示,仅优化固定模型周围的中间件、工具定义和系统提示词,就能使系统评分跃升13.7分。当一个系统出现输出故障时,根本原因通常不是模型不够聪明,而是外壳缺少某个关键API、规则定义冲突或者上下文窗口被过量噪音数据阻断。

两种模式的存在是为了应对AI辅助开发中长期存在的“80% 难题 (The 80% problem)”。当前阶段的语言模型能够以极高的速度输出某项功能80% 的主体代码,但剩余的20%(边缘用例、错误处理、复杂集成点和微妙的正确性要求)需要深度的业务上下文,这是当前模型难以处理的。这类概念性错误具有隐蔽性,因为代码往往“看起来正确”且能通过基础测试。高效的开发者会将AI用于处理良好定义的高速实现,而将自身的注意力集中在应对这20% 的架构权衡和正确性验证上。
在评估技术引入的商业影响时,总拥有成本(TCO)比单纯的开发速度更具决定性。

在此经济模型中,上下文工程成为一项直接的财务杠杆。通过提供高信息密度的载荷(如精确的AGENTS.md文件),可以避免因提示词噪音导致的反复试错成本。进一步地,研究者建议采用“智能模型路由 (Intelligent Model Routing)”策略:将高复杂度的架构和初始实现任务分配给庞大、昂贵的前沿模型;而将确定性、低复杂度的任务(如测试生成、代码审查)自动路由至体积更小、速度更快、成本更低的模型,从而系统性地压低运营Token成本。
对于希望将该框架落地的从业者,研究者提供了以下切实的行动建议。
对于一线个人开发者:
对于工程团队领导者:
对于组织机构的技术决策者:
在当前的工程语境下,代码生成的难题已被实质性攻克。软件工程的核心技艺正在从具体的实施编写,向上层转移至验证、判断与方向指引。组织必须认识到,结构化的工程纪律具备规模化能力,而松散的“氛围”则不具备。AI工具将客观地放大您团队现有的工程文化,它既能放大纪律带来的优势,也会无情地放大流程缺失造成的混乱。
文章来自于"AI修猫Prompt",作者 "AI修猫Prompt"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0