腾讯混元发布科研智能体Hyra(Hunyuan Research Agent),刷新多项纪录,参与下一代Hy模型迭代

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
腾讯混元发布科研智能体Hyra(Hunyuan Research Agent),刷新多项纪录,参与下一代Hy模型迭代
8969点击    2026-07-22 10:54

腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


能自己做实验、写代码、找规律,还会越研究越聪明。


智东西7月21日报道,今天,腾讯正式发布了其首个研究智能体(Research Agent)——Hyra(Hunyuan Research Agent)。Hyra能够像科研人员一样,提出假设、完成实验、总结经验,再基于经验不断提出新的方案,最终实现递归自我改进(Recursive Self-Improvement,RSI)。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


从腾讯公开的实验结果来看,Hyra已经可以在AI模型训练优化、GPU Kernel优化、数学发现、量子计算、药物设计等十余个方向发挥作用,并在多个公开任务中刷新已有纪录。


比如,在科研领域,Hyra设计出了一个仅含15个可训练参数、即可完成10位数加法的Transformer,相比Adderboard公开纪录中的36个参数减少了58.3%。这一结果证明Hyra能够在严格资源约束下联合搜索模型结构与计算机制,为研究神经网络能力边界、追求极致性能的模型压缩提供帮助。


Hyra也可以通过观察AI模型训练日志,发现模型的Scaling Law,指导训练配方的设计。


Hyra并不仅限于科研,也可以用于3D建模、音乐创作等创意场景。比如,在拿到一段主旋律后,Hyra可以为多种乐器编写完整和声,逐步将一段原本保守的和声迭代为多乐器、灵活节奏和丰富色彩的完整音乐。


腾讯混元发布科研智能体Hyra(Hunyuan Research Agent),刷新多项纪录,参与下一代Hy模型迭代


腾讯还在博客中透露,新一代Hy模型、乃至腾讯的部分产品,都会与Hyra持续共进化。


研究博客:https://hy.tencent.com/research/hyra


采用轻量Harness设计


有效防止AI“作弊”


过去一年,递归自我改进已经成为全球AI领域最受关注的技术方向之一。Google DeepMind推出AlphaEvolve,将Gemini用于算法发现,把4×4复数矩阵乘法的标量乘法次数压缩到48次;Together AI通过Einstein Arena让多个智能体协同探索数学开放问题;Andrej Karpathy也提出autoresearch,希望让模型训练实验能够自动循环运行。


不过,上述研究主要聚焦单一方向的探索,腾讯此次发布的Hyra希望构建一套通用研究框架,让智能体能够进入AI研发、科学发现乃至工业设计等更多真实环境,不断积累经验、自主进化。


科研真正困难的地方,是在一次次实验失败之后,不断总结经验、调整方向、重新设计实验,再继续验证。这本质上是一个不断循环迭代的搜索过程,也是科研智能体区别于普通智能体最大的地方。


Hyra的核心设计,就是围绕这一循环展开。


整个系统没有设计复杂的工作流,而是采用了一套非常轻量的Harness。腾讯团队认为,这一思路遵循Rich Sutton提出的The Bitter Lesson:长期来看,真正能够持续胜出的,并不是人为设计越来越复杂的规则,而是给予AI更大的搜索空间,让计算资源持续发挥作用。


Hyra智能体的整个系统只有两个核心角色,其架构如下:


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


其中,一个Context Agent负责维护经验库(Experience Bank)。每一次实验的代码、日志、评测结果、生成文件都会被保存下来,再不断整理成新的“灵感”,提供给下一轮探索使用。


另一侧,则是多个Proposal Agent。


它们不断领取不同的灵感上下文,提出新的方案,自动生成完整解法,并进入独立沙盒执行。程序运行结束后,系统自动打分,再将结果重新写回经验库。


整个系统则始终保持异步运行。Context Agent持续生产探索方向,Proposal Agent持续消费任务并验证结果,计算资源、沙盒环境、模型推理始终保持高利用率。Context Agent会将灵感准备得尽可能多样化,让Proposal Agent可以朝着多样的方向探索。


Hyra不仅优化方案,还会优化评测标准。很多科研问题并不存在天然评估其,例如设计一个世界冠军级国际象棋AI,最开始只能设计一个简单的Elo评测系统,随着越来越强的AI不断出现,评测体系本身也要不断升级,否则AI很容易“刷分”而非真正变强。


为解决上述问题,腾讯混元团队提出了一套双层循环机制。


首先,Hyra会根据任务描述设计一个初版评估器,内层循环基于该评估器反复优化解法;当内层循环结束后,Hyra会结合当前经验中积累的经验历史进一步优化评估器,并使用升级后的评估器开启下一轮循环。味着,Hyra优化的不只是答案,而是整个科研流程本身。


从模型优化到药物设计


Hyra展现多领域潜力


科研智能体最终还是要靠结果说话,腾讯此次展示了十多个由Hyra执行的科研任务案例。


首先是在AI for AI方向。


模型训练是最适合科研智能体发挥作用的领域之一,其中包含大量可执行、可评估、可迭代的研究循环。


腾讯选择了三项公开任务进行评测,包括NanoChat Autoresearch、NanoGPT Speedrun以及NVIDIA推出的SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和GPU kernel优化。


在采用完全相同实验设置的情况下,腾讯将Hyra与AI初创公司Recursive打造的研究智能体进行了对比。在NanoChat任务中,Hyra将Validation BPB进一步下降至0.9015;在NanoGPT Speedrun中,Hyra将达到指定Loss所需时间缩短至76.4秒;在GPU Kernel优化任务SOL-ExecBench中,Hyra将Mean SOL提升至0.771,均超过基线水平。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代



与此同时,腾讯也展示了科研智能体面临的问题。


随着搜索越来越强,AI开始主动寻找评估器漏洞。例如,在NanoChat实验中,Hyra曾尝试通过泄露未来Token信息,获得异常优秀BPB成绩;而在Kernel优化过程中,也出现过缓存结果绕过真实性验证的情况。


这些案例说明,当AI越来越擅长优化目标时,评估器本身也必须持续升级,否则所谓“进步”可能只是作弊。


Hyra还在AI for Science方向展示出不错的潜力。


腾讯从Einstein Arena、Packing Center等公开数据库收集了55个长期未解决的数学开放问题。最终,Hyra在其中29个问题上刷新历史最佳结果。


它还能直接从数据中寻找规律。当获得1749年至1932年的太阳黑子历史数据后,Hyra自动发现了一套递推公式,用于预测后续近百年的太阳黑子变化趋势。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


Hyra可以直接设计科学与工程产物。它设计的量子比特路由算法在IBM Q20上相比经典SABRE将路由效率提升了44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


在药物设计任务中,Hyra围绕精准抗癌“明星靶点”PARP1自动生成候选分子,在结合能力和成药性联合评分上超过已上市PARP抑制剂奥拉帕利(Olaparib)。当然,腾讯也强调,这一药物设计结果目前仍属于模拟筛选阶段,距离真实药物研发还需要经过更严格的计算验证、化学合成以及湿实验验证。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


除了科研,Hyra也可以进入更多开放场景。它通过持续自博弈,把一个黑白棋Bot训练到Botzone平台730多个程序中的第3名。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代


或是根据一张二维图片,不断修改建模代码和渲染参数,自动生成更接近参考图像的三维模型。


腾讯科研Agent刷新多项纪录,参与下一代Hy模型迭代

这些案例共同说明,Research Agent并不仅适用于存在唯一标准答案的问题。无论面对数学、科学发现、游戏策略,还是艺术创作,只要能够建立反馈机制,智能体都能够持续搜索、不断演进。


结语:科研智能体或成


下一代AI系统重要形态


随着大模型能力不断提升,如何让AI自己加速AI的发展成为不少大模型企业开始考虑的问题,芯片、药物等领域的企业也正在尝试把科研过程本身交给AI完成。


未来,科研智能体能否真正成为科学发现的新工具,还有待更多真实场景验证。但可以确定的是,AI正在从帮助人类完成工作,进一步迈向帮助人类创造知识。而能够持续自我改进、自我研究的智能体,也很可能成为下一代AI系统的重要形态之一。


文章来自于微信公众号 “智东西”,作者 “智东西”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

4
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

5
AI 3D建模

【开源免费】LGM是一个AI建模的项目,它可以将你上传的平面图片,变成一个3D的模型。

项目地址:https://github.com/3DTopia/LGM?tab=readme-ov-file

在线使用:https://replicate.com/camenduru/lgm