昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!
8912点击    2026-08-20 08:41

昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!


Claude Code、Codex子代理体系扩容。


智东西8月20日报道,昨夜,DeepSeek Harness迎来公测后的首次重要更新。DeepSeek Harness v0.1.0-rc.8版本上线多模态能力成为这次更新的重头戏。


此次更新共带来14项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,既补齐了Agent处理图片等多模态任务的能力,也进一步完善了子代理协作、终端交互和工具调用体验。


昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!


新版支持原生图片请求和图文混合输入,/goal、/plan等命令也可以直接接收图片;与此同时,Claude Code、Codex进一步接入其子代理体系Windows终端体验以及图片请求、流式生成、自定义网关等一批问题也得到修复。


DeepSeek Harness于8月13日正式开启v0.1版本公测并同步开源。公测当晚,智东西曾第一时间拉取源码进行实测,用它完成88页论文翻译、贪吃蛇游戏开发等任务。


仅过去不到一周,这套Agent Harness又把多模态补上了。这次更新很快引起了DeepSeek Harness社区讨论。


有国内开发者看到更新后直接感叹:“DSH支持多模态了,奔走相告!”


昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!


海外开发者同样把注意力放在这两项能力上。有网友评价称,DeepSeek Harness正变得“越来越有意思”,多模态支持和更完善的子代理集成是一次明显推进。


昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!


更有意思的是,有开发者进一步扒出了DeepSeek Harness的“看图”方式:面对本身不支持图像输入的模型,它还能调用OCR、颜色统计、像素扫描等工具,把图片拆成结构化信息后再交给文本模型推理,相当于给纯文本模型拼出一套工具层的“视觉”。


GitHub:


https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8


多模态正式补齐,直接“看图”


rc.8最明显的变化,就是DeepSeek Harness进一步补齐了多模态输入。


根据官方更新日志,DeepSeek模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness可以直接把图片送进模型;/goal、/plan等指令也已经支持图文混合输入。


同时,输入框中的@菜单新增文件和会话引用,用户可以直接把本地文件、已有会话等内容拉进当前任务。


这意味着,过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以进一步把截图、图片等视觉信息纳入任务上下文。


子代理体系也继续扩充。


新版支持把Claude Code和Codex作为Profile Bundle按需安装。其中,Codex支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同Codex子代理。


Windows用户这次也被重点照顾。DeepSeek Harness的PTY终端加入持久PowerShell会话,并在极简模式预设中默认开启,减少命令执行过程中频繁重建终端环境的问题。


除了新能力,这次更新还集中修掉了一批公测后暴露的问题。


比如,当单张图片尺寸过大,或者历史会话中累积图片过多时,此前可能导致模型请求直接失败;新版对此进行了处理。


取消一次流式生成后,已经显示出来的回复前缀此前也可能不会被带入下一轮提问或者分叉会话,这一问题目前已经修正。


对于使用自定义OpenAI兼容网关的开发者,新版还修复了部分网关因请求格式差异而无法调用,以及推理内容回传缺失的问题。


纯文本模型也能“看图”


OCR和像素分析拼出工具层视觉


DeepSeek Harness补上原生图片请求之外,一个有意思的细节很快被开发者扒了出来。


网友Yinsen测试DeepSeek Harness处理图片时发现,当所调用的模型本身没有声明图像输入能力,直接调用read_image会首先失败。


昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!


但任务并没有就此停下。从其展示的执行轨迹来看,Harness随后会退化到另一套工具链:先进行OCR文字识别,再统计图片中的颜色比例、扫描部分像素行,同时读取图片尺寸、色彩模式等元信息。


例如,一张包含文字和简单图形的图片,可以被拆成“文字内容及坐标”“背景颜色比例”“特定区域像素变化”“图片尺寸”等多组信息。


最后,这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据“脑补”出整张图的大致内容。


因此,这种能力和视觉大模型直接理解图片仍然有明显区别。对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征得到不少有效信息;面对真实照片、复杂空间关系等内容,这种工具链能够恢复的信息则会受到明显限制。


但从Agent Harness的角度看,这个设计颇有意思:视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作。


事实上,在官方加强多模态支持之前,DeepSeek Harness社区已经围绕视觉能力出现了一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。


其中一些方案就是通过OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置input: [text, image],直接接收图片。


rc.8上线后,原生多模态模型和这类工具层视觉方案可以进一步配合使用。


上线不到一周加速迭代


盯上了多模态和子代理


8月13日公测时,DeepSeek Harness团队就强调,其核心设计思路是“一切皆插件”:模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。当Agent Harness拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。


此次rc.8又继续强化了这种插件化思路:视觉模型可以原生接收图片,纯文本模型也能借助视觉工具获得部分图像信息;Claude Code和Codex则可以作为子代理按需装进同一套Harness中。


除了这些核心变化,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。


结语:一切皆插件


把模型能力“拆开重组”


从8月14日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。


接下来值得期待的,是这套插件化Harness能否继续把更多模型、工具和Agent装进同一个体系,并跑出更复杂、更稳定的任务流程。


文章来自于微信公众号 “智东西”,作者 “智东西”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md