腾讯混元发布Hyra-1.0科研智能体:递归自我改进覆盖AI研发与科学发现

2026年7月21日,腾讯混元团队正式发布首个版本的科研智能体 Hyra-1.0,全称为Hunyuan Research Agent。

与主要负责搜索资料、总结论文和生成研究报告的普通研究助手不同,Hyra面向的是结果可以被客观指标验证的研究与工程任务。它会反复提出候选方案、执行实验、读取评分、分析失败原因,并将有效经验用于下一轮探索,直到获得更好的性能结果。

Hyra目前展示的任务覆盖三个方向:

AI for AI:使用AI改进模型训练、代码和GPU内核
AI for Science:探索数学、药物、量子计算和科学预测问题
AI for Fun:完成游戏智能体、三维建模和音乐编配

腾讯混元还同步开放了Hyra成果仓库,收录最终解决方案、研究产物及部分可独立运行的复现脚本。

image.png

Hyra-1.0是什么?

Hyra-1.0是一套围绕“提出方案—运行实验—获得评分—继续改进”建立的科研智能体系统。

传统大模型面对研究问题时,通常生成一个答案或一份实验方案。即使答案不够好,也需要用户重新提供反馈或修改提示词。

Hyra则把任务当作一个可以持续优化的过程:

1.理解研究目标和评价指标
2.从历史经验中生成新的探索方向
3.编写代码或设计解决方案
4.在独立环境中运行实验
5.获取准确率、速度或损失等指标
6.比较不同候选方案
7.保留有效经验并继续迭代
8.输出当前发现的最佳方案

这种方式尤其适合模型训练、算法搜索、性能优化和科学计算,因为这些任务通常存在明确、可重复测量的目标。

例如:

验证损失越低越好
GPU内核运行速度越快越好
量子线路新增门数量越少越好
分子对接目标值越低越好
预测模型的R²越高越好

“递归自我改进”不等于自动修改模型权重

“递归自我改进”容易让人误以为Hyra会自主修改底层大模型的参数,甚至重新训练出一个新的自己。

从腾讯目前公开的工作方式来看,Hyra主要进行的是任务级递归改进

生成一个候选方案
执行并评价该方案
总结成功与失败经验
根据经验生成更好的候选方案
重复这一循环

它改进的是代码、算法、参数配置、实验方法和最终解决方案,而不是已经公开展示了自动重写自身基础模型权重的能力。

这一区别很重要。Hyra更接近一套能够持续做实验的自动研究系统,而不是脱离评价标准、无限修改自身模型结构的系统。该判断是根据腾讯公开的Context Agent、Proposal Agents和成果仓库结构作出的分析。

Hyra采用轻量Harness框架

腾讯混元将Hyra描述为一套简单、通用的科研Harness。

Harness可以理解为智能体的运行框架,负责组织模型、工具、实验环境、任务队列、评价指标和历史经验。

Hyra的设计重点不是堆叠大量固定规则,而是:

尽量保持框架简单
为智能体提供较大的动作空间
允许并行尝试不同方案
使用客观评价结果推动迭代
随着算力增加开展更多实验

这一路线受到“The Bitter Lesson”思想影响,即相比为每个问题编写大量人工规则,更通用并且能够利用计算资源扩展的方法,通常更具长期潜力。腾讯将这一思路概括为用轻量框架和更广的动作空间,把模型能力与计算资源转化为可测量的性能收益。

Context Agent负责生成研究灵感

Hyra的一个核心组件是 Context Agent

Context Agent负责维护经验库,并根据此前实验结果持续产生新的“灵感上下文”,再将这些内容放入任务队列。

经验库可能包括:

已经测试过的方案
成功方案使用的技巧
失败实验及错误原因
不同参数组合的结果
相关论文和已有算法
仍未探索的方向
可以组合使用的历史发现

Context Agent并不是直接完成全部研究工作,而是为后续执行智能体准备不同探索方向。

例如,在优化训练速度时,它可能提出:

调整学习率计划
替换优化器
修改批次大小
改变数据排列方式
重写关键算子
调整网络宽度或深度
组合此前两个有效方案

这样可以减少智能体反复从同一个起点出发,提高后续实验的多样性。

Proposal Agents并行运行实验

任务队列中的研究方向会交给多个 Proposal Agents

每个Proposal Agent可以从队列中领取一个上下文,在独立沙盒中:

阅读已有代码
设计新方案
修改程序
运行训练或测试
收集性能指标
输出实验结果
将有效发现写回经验库

多个Proposal Agents可以同时探索不同方案,不必等待前一个实验全部结束后再开始下一个。

腾讯将这一结构描述为异步的生产者—消费者管线:

Context Agent持续生产研究方向
Proposal Agents持续领取并执行任务
不同实验按照各自速度完成
计算资源空闲后可以继续领取新任务
实验结果反向补充经验库

这种架构适合计算时间差异较大的研究任务。例如,一个参数实验可能只需要几分钟,而GPU内核优化或模型训练可能需要更长时间。异步运行可以减少部分任务等待时造成的资源闲置。

Hyra适合什么类型的科研任务?

Hyra最适合同时具备以下特点的问题:

结果可以量化

任务需要有准确率、运行时间、损失值、能耗、物理约束或其他明确指标。

实验可以自动运行

候选方案能够通过代码、模拟器、编译器或科学计算工具自动执行。

结果可以重复验证

同一个方案在相同条件下应产生相对稳定、可比较的结果。

搜索空间足够大

问题存在大量参数、算法或结构组合,人工难以逐一测试。

单次失败成本可控

失败实验应在沙盒或模拟环境中完成,不会直接造成现实世界的严重损失。

因此,Hyra现阶段更适合机器学习、算法工程、数学搜索、计算化学和量子线路优化,而不是缺少客观评价标准的纯主观决策。

AI for AI:让AI优化AI系统

AI for AI指使用人工智能研究和改进人工智能系统本身。

Hyra在这一方向测试了三个主要任务:

任务 评价指标 此前最佳结果 Hyra-1.0
NanoChat Autoresearch 验证集BPB,越低越好 0.9109 0.9015
NanoGPT Speedrun 达到目标损失的时间 77.5秒 76.4秒
SOL-ExecBench GPU内核综合得分 0.754 0.771

腾讯公布的成果显示,Hyra在这三个任务上均超过了Recursive《First Steps Toward Automated AI Research》报告的对应结果。

NanoChat Autoresearch:自动改进语言模型训练

NanoChat Autoresearch任务要求智能体持续修改语言模型的训练方案,并降低验证集BPB。

BPB可以用于衡量模型压缩和预测文本信息的效率,数值越低通常代表模型对验证数据的预测能力越强。

Hyra最终将验证集BPB从此前公开结果的0.9109降低至0.9015。

在这一过程中,智能体可能需要反复调整:

模型结构
训练超参数
优化器设置
数据处理方式
正则化方法
学习率计划
训练代码实现

单次数值提升看起来不大,但在已经经过大量研究者持续优化的任务上,进一步压低指标通常需要测试许多细微方案。

NanoGPT Speedrun:将训练时间缩短至76.4秒

NanoGPT Speedrun要求在固定硬件和规则下,尽快将模型训练到目标验证损失。

这类任务同时考验:

模型架构
优化器
混合精度训练
数据加载速度
GPU算子效率
编译与内存管理
超参数组合

此前公开结果需要77.5秒,Hyra将时间进一步缩短至76.4秒。

虽然只缩短了1.1秒,但NanoGPT Speedrun已经被社区进行过大量优化,剩余提升空间较小。在这种环境中,智能体还能发现新的有效组合,说明其能够进入较为成熟的工程优化问题。

SOL-ExecBench:同时优化235个GPU内核

SOL-ExecBench用于评价模型生成和优化GPU内核的能力。

Hyra针对235个GPU内核任务进行联合优化,将平均SOL得分从0.754提高至0.771。

GPU内核优化可能涉及:

内存访问方式
线程块和网格配置
数据布局
算子融合
寄存器占用
共享内存使用
并行粒度
编译器指令

这类任务既需要理解算法,又需要根据真实运行结果调整底层实现,适合采用“生成—运行—跑分—继续修改”的循环。

AI for Science:探索数学和科学问题

在AI for Science方向,Hyra处理了数学开放问题、符号预测、药物分子设计、量子线路路由和极小神经网络设计等任务。

腾讯官方介绍称,团队从EinsteinArena等来源收集了55个数学开放问题,Hyra在其中29个问题上取得了新的最好已知结果。

公开成果仓库进一步列出了多项具体结果,包括:

自相关常数优化
Erdős最小重叠问题
和集与差集指数
几何图形嵌套打包
15参数十位数加法Transformer
PARP1分子对接
量子比特路由
太阳黑子符号预测

这些成果的最终方案和部分复现代码已放入Hyra-results仓库。

55个数学开放问题中29项刷新最好结果

数学开放问题往往没有现成标准答案,但可以通过更优的上界、下界、常数或构造方案判断研究是否取得进展。

Hyra围绕不同数学问题自动搜索:

函数构造
数值参数
几何排列
离散集合
自相关关系
组合结构

在公开成果中,Hyra还刷新了100项几何图形嵌套打包纪录,覆盖28类“形状放入形状”的问题。官方仓库说明,这些结果已经被相关公开纪录页面标记为Hyra团队发现。

需要注意的是,“新最好已知结果”不一定等同于完成严格数学证明。

部分结果可能是更好的数值构造、优化值或计算机搜索结果,仍需要数学研究者检查证明条件、误差边界和可复现性。

用15个参数完成十位数加法

Hyra设计了一个仅包含 15个可训练参数的Transformer,用于计算两个十位整数的加法,并达到至少99%的准确率。

此前AdderBoard公开纪录使用36个可训练参数,Hyra将参数数量减少约58.3%。

这项实验关注的不是打造通用语言模型,而是研究一个神经网络完成明确算法任务时,最少需要多少可训练参数。

它可以用于探索:

神经网络如何学习算术规则
哪些结构是真正必要的
参数共享能够压缩到什么程度
Transformer是否能形成紧凑算法表示

太阳黑子预测R²提高至0.78

Hyra使用历史月度太阳黑子数据寻找符号预测公式,并在完全留出的长期数据上进行滚动预测。

官方成果仓库显示,基线方法的预测R²为0.47,Hyra发现的方案将R²提高至0.78。评测采用连续24个月的自由运行预测,并在未参与搜索的长期数据区间上计算结果。

这类符号回归任务的目标,是找到相对简洁、可以解释的数学关系,而不是只训练一个难以理解的黑箱模型。

不过,R²提升不代表已经完整解释太阳活动规律。太阳黑子变化涉及复杂物理过程,单一时间序列公式仍可能在不同太阳周期中失效。

优化量子比特路由

量子计算机中的物理量子比特通常不能与任意其他量子比特直接交互。

当算法需要连接两个不相邻的量子比特时,系统必须增加SWAP操作。每个SWAP通常会进一步转换成多个CNOT门,增加线路深度和错误概率。

Hyra在量子比特路由任务中,将额外CNOT门数量从269037个减少至258369个,按照官方公布的数据,减少约4%。

这一结果与部分媒体报道中的“提升44.4%”口径并不一致。按照官方成果仓库当前列出的CNOT数量计算,更适合直接呈现原始数值,而不是沿用未经统一口径说明的百分比。

生成PARP1候选分子

PARP1是一种参与DNA损伤修复的蛋白,也是部分癌症药物研究中的重要靶点。

Hyra围绕PARP1开展分子设计和对接优化,使用Vina对接分数与药物相似性QED组成评价目标。

官方仓库显示,作为对照的奥拉帕利目标值为-9.77,Hyra找到的候选方案达到-10.60;在该评价函数中,数值越低越好。

不过,计算机对接结果不能直接证明候选分子安全、有效或能够成为药物。

后续仍需要经过:

合成可行性分析
分子动力学验证
细胞实验
动物实验
毒理与药代研究
临床试验

因此,这项成果更适合作为计算药物设计中的候选筛选结果,而不是临床结论。

AI for Fun:游戏、三维和音乐创作

腾讯还使用Hyra测试开放式创作与游戏任务。

官方成果仓库目前公开了四类案例:

一个AlphaZero风格的8×8黑白棋智能体
《望春風》的五声部编配
使用单个Blender Python脚本生成的三维QQ企鹅
程序化生成的腾讯混元三维标志球体

这些案例没有统一排行榜对比,主要用于展示相同智能体框架能否在游戏策略、三维设计和音乐编配中持续迭代。

黑白棋智能体并非围棋程序

部分中文报道将Hyra的游戏案例写成了“围棋程序”,但官方仓库明确标注其为:

AlphaZero-style Reversi(Othello)bot

也就是AlphaZero风格的黑白棋智能体。

该程序包含:

C++模式与n-tuple网络
PUCT蒙特卡洛树搜索
精确残局求解器
Botzone 8×8对战环境

这也说明阅读AI产品报道时,需要区分围棋、黑白棋和其他棋类任务,它们的棋盘规则、搜索空间和模型难度并不相同。

单张参考图生成可渲染三维模型

Hyra的三维案例使用Blender Python接口生成程序化模型。

与直接输出一张三维效果图不同,脚本需要真正建立:

基础几何体
位置与比例
材质和颜色
摄影机
灯光
可渲染场景

官方仓库开放了三维QQ企鹅和混元标志球体的成果目录,开发者可以查看最终脚本和产物。

程序化建模的优势是结果可继续修改,设计人员可以调整模型尺寸、材质、节点和动画,而不是只能获得一个固定图像。

Hyra与普通Deep Research智能体有什么区别?

对比方向 普通深度研究智能体 Hyra-1.0
主要目标 搜索并总结信息 持续提高可测量性能
典型输出 报告、摘要、资料整理 代码、算法、实验和最优方案
是否需要执行环境 不一定 通常需要沙盒和工具
评价方式 内容质量和来源 损失、速度、分数等指标
迭代方式 用户追加问题 系统自动运行多轮实验
适合场景 行业调研、论文综述 模型训练、科学计算、工程优化

二者并不是相互替代的关系。

普通研究智能体更适合搜集背景资料和整理已有知识;Hyra更适合在已有问题和评价标准下运行大量实验,寻找更好的解决方案。

Hyra的优势在哪里?

同一框架覆盖多个研究领域

腾讯没有为每一个案例分别开发完全不同的智能体系统,而是使用同一套通用循环覆盖模型训练、数学、量子计算、药物和创作任务。

可以利用更多计算资源并行探索

Context Agent持续产生方向,多个Proposal Agents并行执行,有机会随着计算资源增加测试更多候选方案。

结果可以客观比较

验证损失、训练时间和对接分数等指标,可以减少只依靠模型自行判断答案质量的问题。

经验可以跨轮次积累

系统保存成功与失败经验,避免后续智能体不断重复已经验证无效的方案。

产物可以复现

官方仓库不仅展示宣传案例,还提供多个最终方案及相应脚本,方便研究者检查结果。

Hyra可能面临哪些限制?

依赖高质量评价指标

如果评价指标不能真实反映目标,智能体可能找到“分数很高但实际无用”的方案。

例如,一个程序可能通过针对测试集的特殊处理取得高分,却无法在新数据中保持效果。

存在奖励投机风险

只要系统围绕指标持续搜索,就可能发现评价机制中的漏洞。

因此,关键科研任务仍需检查方案是否真正满足物理、数学和工程约束。

计算成本可能较高

递归改进意味着需要运行大量候选实验。即使智能体框架较轻,模型调用、GPU训练和科学模拟仍可能消耗大量计算资源。

不适合缺少评价器的主观任务

审美、社会影响和长期战略等问题很难用单一分数评价,Hyra在这些任务中的自动改进能力可能受到限制。

科研结果仍需同行验证

更好的数值结果不一定等于严格证明,更高的分子对接分数也不等于新药有效。

研究人员仍需复现、检查和解释智能体发现的结果。

Hyra是否已经完整开源?

目前更准确的答案是:

腾讯已经开放Hyra的研究成果仓库,但尚不能据此判断完整Hyra智能体运行框架已经全部开源。

当前公开的Hyra-results仓库包含:

AI4AI最终方案
AI4Science研究产物
AI4Fun程序与设计结果
部分自包含复现脚本
不同任务的指标和此前最好结果
Apache 2.0许可证

仓库README将其明确描述为“Companion artifacts”,即随Hyra发布的配套研究产物。仓库的核心作用是展示和复现Hyra发现的结果,而不是提供完整的Context Agent、任务调度、并行沙盒和全部运行基础设施。

因此,文章中使用“Hyra成果和研究产物已开放”会比“Hyra完整框架已经开源”更加准确。

Hyra未来可能进入哪些场景?

腾讯混元表示,未来将把Hyra进一步接入产品系统、真实AI研发管线和产业场景,并推动智能体框架、研究数据和基础模型之间形成持续迭代。

潜在应用包括:

大模型训练

自动搜索数据配方、模型结构、训练参数和强化学习策略。

GPU与AI芯片优化

重写算子、优化编译器、寻找更高效的内核实现。

材料和药物研究

根据模拟与实验指标筛选候选结构。

数学和算法研究

探索新的边界、构造方案和数值纪录。

量子计算

优化量子线路映射、门数量和执行路径。

工业工程

在仿真环境中优化调度、控制和生产参数。

使用科研智能体需要注意什么?

保存完整实验记录

应记录模型版本、提示词、代码、随机种子、数据和硬件环境,确保结果可以复现。

使用独立测试集

避免智能体不断针对同一评价集优化,最终只获得过拟合结果。

检查指标与真实目标是否一致

分数提升应能够转化为实际的性能、准确率或科学价值。

隔离高风险执行环境

智能体生成和运行代码时,应使用沙盒、权限限制和资源配额。

保留专家审核

数学证明、药物设计、量子算法和工业方案都需要相应领域专家验证。

总结

Hyra-1.0是腾讯混元推出的递归自我改进科研智能体,主要面向具有明确评价指标的研究与工程任务。

系统通过Context Agent维护经验库并产生研究方向,再由多个Proposal Agents在独立沙盒中并行生成、运行和评价解决方案,形成异步的持续探索管线。

在AI for AI方向,Hyra在NanoChat Autoresearch、NanoGPT Speedrun和SOL-ExecBench三项任务中超过了Recursive报告的对应结果。

在AI for Science方向,腾讯称Hyra对55个数学开放问题进行探索,并在29项上取得新的最好已知结果;公开成果还包括15参数十位数加法模型、太阳黑子预测、量子比特路由和PARP1候选分子设计。

在AI for Fun方向,Hyra完成了黑白棋程序、五声部音乐编配和程序化三维模型,展示同一框架向开放创作任务扩展的可能性。

此次发布的价值不只是增加一个能够阅读论文的AI助手,而是尝试建立一套可以持续做实验、读取指标并积累研究经验的通用系统。

不过,Hyra发现的数值结果仍需人工复现和领域专家验证。目前官方开放的主要是成果与复现产物,并非完整Hyra框架源码。科研智能体能否稳定进入真实研发流程,还要继续观察其计算成本、评价可靠性、安全边界和跨领域复现情况。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...