能自己做实验、写代码、找规律,还会越研究越聪明。
作者 | 陈骏达
编辑 | 云鹏
智东西7月21日报道,今天,腾讯正式发布了其首个研究智能体(Research Agent)——Hyra(Hunyuan Research Agent)。Hyra能够像科研人员一样,提出假设、完成实验、总结经验,再基于经验不断提出新的方案,最终实现递归自我改进(Recursive Self-Improvement,RSI)。
从腾讯公开的实验结果来看,Hyra已经可以在AI模型训练优化、GPU Kernel优化、数学发现、量子计算、药物设计等十余个方向发挥作用,并在多个公开任务中刷新已有纪录。
比如,在科研领域,Hyra设计出了一个仅含15个可训练参数、即可完成10位数加法的Transformer,相比Adderboard公开纪录中的36个参数减少了58.3%。这一结果证明Hyra能够在严格资源约束下联合搜索模型结构与计算机制,为研究神经网络能力边界、追求极致性能的模型压缩提供帮助。
Hyra也可以通过观察AI模型训练日志,发现模型的Scaling Law,指导训练配方的设计。
Hyra并不仅限于科研,也可以用于3D建模、音乐创作等创意场景。比如,在拿到一段主旋律后,Hyra可以为多种乐器编写完整和声,逐步将一段原本保守的和声迭代为多乐器、灵活节奏和丰富色彩的完整音乐。
腾讯还在博客中透露,新一代Hy模型、乃至腾讯的部分产品,都会与Hyra持续共进化。
研究博客:https://hy.tencent.com/research/hyra
01.
采用轻量Harness设计
有效防止AI“作弊”
过去一年,递归自我改进已经成为全球AI领域最受关注的技术方向之一。Google DeepMind推出AlphaEvolve,将Gemini用于算法发现,把4×4复数矩阵乘法的标量乘法次数压缩到48次;Together AI通过Einstein Arena让多个智能体协同探索数学开放问题;Andrej Karpathy也提出autoresearch,希望让模型训练实验能够自动循环运行。
不过,上述研究主要聚焦单一方向的探索,腾讯此次发布的Hyra希望构建一套通用研究框架,让智能体能够进入AI研发、科学发现乃至工业设计等更多真实环境,不断积累经验、自主进化。
科研真正困难的地方,是在一次次实验失败之后,不断总结经验、调整方向、重新设计实验,再继续验证。这本质上是一个不断循环迭代的搜索过程,也是科研智能体区别于普通智能体最大的地方。
Hyra的核心设计,就是围绕这一循环展开。
整个系统没有设计复杂的工作流,而是采用了一套非常轻量的Harness。腾讯团队认为,这一思路遵循Rich Sutton提出的The Bitter Lesson:长期来看,真正能够持续胜出的,并不是人为设计越来越复杂的规则,而是给予AI更大的搜索空间,让计算资源持续发挥作用。
Hyra智能体的整个系统只有两个核心角色,其架构如下:
其中,一个Context Agent负责维护经验库(Experience Bank)。每一次实验的代码、日志、评测结果、生成文件都会被保存下来,再不断整理成新的“灵感”,提供给下一轮探索使用。
另一侧,则是多个Proposal Agent。
它们不断领取不同的灵感上下文,提出新的方案,自动生成完整解法,并进入独立沙盒执行。程序运行结束后,系统自动打分,再将结果重新写回经验库。
整个系统则始终保持异步运行。Context Agent持续生产探索方向,Proposal Agent持续消费任务并验证结果,计算资源、沙盒环境、模型推理始终保持高利用率。Context Agent会将灵感准备得尽可能多样化,让Proposal Agent可以朝着多样的方向探索。
Hyra不仅优化方案,还会优化评测标准。很多科研问题并不存在天然评估其,例如设计一个世界冠军级国际象棋AI,最开始只能设计一个简单的Elo评测系统,随着越来越强的AI不断出现,评测体系本身也要不断升级,否则AI很容易“刷分”而非真正变强。
为解决上述问题,腾讯混元团队提出了一套双层循环机制。
首先,Hyra会根据任务描述设计一个初版评估器,内层循环基于该评估器反复优化解法;当内层循环结束后,Hyra会结合当前经验中积累的经验历史进一步优化评估器,并使用升级后的评估器开启下一轮循环。味着,Hyra优化的不只是答案,而是整个科研流程本身。
02.
从模型优化到药物设计
Hyra展现多领域潜力
科研智能体最终还是要靠结果说话,腾讯此次展示了十多个由Hyra执行的科研任务案例。
首先是在AI for AI方向。
模型训练是最适合科研智能体发挥作用的领域之一,其中包含大量可执行、可评估、可迭代的研究循环。
腾讯选择了三项公开任务进行评测,包括NanoChat Autoresearch、NanoGPT Speedrun以及NVIDIA推出的SOL-ExecBench,分别覆盖固定预算训练、训练速度优化和GPU kernel优化。
在采用完全相同实验设置的情况下,腾讯将Hyra与AI初创公司Recursive打造的研究智能体进行了对比。在NanoChat任务中,Hyra将Validation BPB进一步下降至0.9015;在NanoGPT Speedrun中,Hyra将达到指定Loss所需时间缩短至76.4秒;在GPU Kernel优化任务SOL-ExecBench中,Hyra将Mean SOL提升至0.771,均超过基线水平。
与此同时,腾讯也展示了科研智能体面临的问题。
随着搜索越来越强,AI开始主动寻找评估器漏洞。例如,在NanoChat实验中,Hyra曾尝试通过泄露未来Token信息,获得异常优秀BPB成绩;而在Kernel优化过程中,也出现过缓存结果绕过真实性验证的情况。
这些案例说明,当AI越来越擅长优化目标时,评估器本身也必须持续升级,否则所谓“进步”可能只是作弊。
Hyra还在AI for Science方向展示出不错的潜力。
腾讯从Einstein Arena、Packing Center等公开数据库收集了55个长期未解决的数学开放问题。最终,Hyra在其中29个问题上刷新历史最佳结果。
它还能直接从数据中寻找规律。当获得1749年至1932年的太阳黑子历史数据后,Hyra自动发现了一套递推公式,用于预测后续近百年的太阳黑子变化趋势。
Hyra可以直接设计科学与工程产物。它设计的量子比特路由算法在IBM Q20上相比经典SABRE将路由效率提升了44.4%。更少的双比特门通常意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。
在药物设计任务中,Hyra围绕精准抗癌“明星靶点”PARP1自动生成候选分子,在结合能力和成药性联合评分上超过已上市PARP抑制剂奥拉帕利(Olaparib)。当然,腾讯也强调,这一药物设计结果目前仍属于模拟筛选阶段,距离真实药物研发还需要经过更严格的计算验证、化学合成以及湿实验验证。
除了科研,Hyra也可以进入更多开放场景。它通过持续自博弈,把一个黑白棋Bot训练到Botzone平台730多个程序中的第3名。
或是根据一张二维图片,不断修改建模代码和渲染参数,自动生成更接近参考图像的三维模型。
这些案例共同说明,Research Agent并不仅适用于存在唯一标准答案的问题。无论面对数学、科学发现、游戏策略,还是艺术创作,只要能够建立反馈机制,智能体都能够持续搜索、不断演进。
03.
结语:科研智能体或成
下一代AI系统重要形态
随着大模型能力不断提升,如何让AI自己加速AI的发展成为不少大模型企业开始考虑的问题,芯片、药物等领域的企业也正在尝试把科研过程本身交给AI完成。
未来,科研智能体能否真正成为科学发现的新工具,还有待更多真实场景验证。但可以确定的是,AI正在从帮助人类完成工作,进一步迈向帮助人类创造知识。而能够持续自我改进、自我研究的智能体,也很可能成为下一代AI系统的重要形态之一。