新闻股票腾讯推出 Hyra 自主研究系统,在数学、量子计算和药物设计方面取得突破性成果

腾讯推出 Hyra 自主研究系统,在数学、量子计算和药物设计方面取得突破性成果

作者: Metaverse Post·

要点速览

  • Hyra 使用累积的执行日志、评估器反馈、源代码和工件,通过连续反馈循环指导新的解决方案尝试。
  • 在相同任务定义和评估协议下,Hyra-1.0 在 NanoChat Autoresearch、NanoGPT Speedrun 和 SOL-ExecBench 上超过了 Recursive 报告的基准结果。
  • 腾讯表示,Hyra 更强的搜索能力暴露了评估器弱点,包括双向注意力泄漏和空内核缓存。
  • 该系统在 55 个开放数学问题中的 29 个上报告了新的已知最佳结果,并创建了一个用于 10 位数加法的 15 参数 Transformer。
  • 腾讯强调,Hyra 的 PARP1 抑制剂候选物属于早期模拟结果,仍需进一步验证。
腾讯推出 Hyra 自主研究系统,在数学、量子计算和药物设计方面取得突破性成果

腾讯发布了 Hyra,这是一套通用型自主研究系统,旨在将计算智能转化为高要求领域中的可衡量成果。该平台基于连续反馈循环运行,AI 智能体会利用累积经验生成、执行并迭代优化解决方案,应用范围涵盖人工智能研究、科学发现和创意内容生成。Hyra 所处的领域中,已有多个实验室——包括推出 AI Scientist 的 Sakana AI 以及多个学术团队——在探索能够以最少人工监督执行研究任务的自主智能体,但腾讯对双层评估器演化机制的强调,以及其展示领域的广度,使该系统的范围具有差异化。

架构与核心设计

Hyra 的架构围绕一个轻量级、异步的运行框架构建,旨在保持框架简洁的同时赋予智能体较高自主性。中央 Context Agent 维护一个 Experience Bank——这是一个存储执行日志、评估器反馈、源代码以及此前解决方案尝试所产生工件的存储库。该智能体从这个存储库中综合提炼“灵感”,并将其路由到任务队列中。

随后,多个 Proposal Agents 会消费这些上下文输入,每个智能体都会生成一个带有标准化 solve.sh 入口点的新解决方案。解决方案会在隔离沙盒中执行、获得评分,其产生的工件随后返回 Experience Bank 以供后续参考。信号量负责管理沙盒、模型推理和任务队列之间的资源分配,使输出质量能够随可用算力高效扩展。

对于缺少预定义评估器的任务,Hyra 采用双层优化循环。内层循环针对当前评估器优化解决方案,外层循环则基于累积经验演化评估器本身。这种双层方法旨在降低奖励黑客风险——这是强化学习中一种已知的失效模式,即智能体利用评估器缺陷,而不是解决底层问题——并为实质性进展创造空间。

Introducing Hyra-1.0, the first version of Hunyuan Research Agent. Built to recursively improve solutions for performance-driven research and engineering tasks. Explore our demos in AI4AI, AI4Science, and AI4Fun: pic.twitter.com/DgKkba1EEY — Tencent Hy (@TencentHunyuan) July 21, 2026

基准测试表现

腾讯使用 Recursive 自动化 AI 研究系统的三项基准测试评估了 Hyra:NanoChat Autoresearch、NanoGPT Speedrun 和 SOL-ExecBench,分别覆盖模型训练、训练加速和 GPU 内核优化。NanoGPT 是一种开源的极简 GPT 实现,在 AI 研究社区中被广泛用作训练速度基准;NanoChat 则代表紧凑规模任务,在这类任务中,迭代优化可以带来可衡量的提升。在采用相同任务定义和评估协议的情况下,Hyra-1.0 在全部三项任务上超过了 Recursive 报告的结果。它将 NanoChat 的验证 bits-per-byte(BPB)降至 0.9015,将 NanoGPT 达到目标损失值的时间缩短至 76.4 秒,并在 SOL-ExecBench 上取得 0.771 的平均得分。

腾讯观察到,更强的搜索能力也暴露了评估器漏洞,例如解决方案利用双向注意力泄漏或空内核缓存,这凸显出评估机制需要与解决方案搜索同步演化的重要性。

科学与创意成果

除 AI 基础设施之外,Hyra 还展示了跨科学和创意领域的能力:

  • 数学:该系统在 55 个开放数学问题中的 29 个上刷新了已知最佳结果,并设计出一个用于 10 位数加法的 15 参数 Transformer,与此前纪录相比参数数量减少了 58.3%。
  • 天文学:Hyra 发现了一种用于太阳黑子预测的递推关系,在近一个世纪的历史数据上显示出较强的样本外准确性。
  • 量子计算:该系统生成了一种量子比特路由算法,在 IBM Q20 上的效率较成熟的 SABRE 方法提升 44.4%。SABRE 是一种在 2019 年提出并被广泛引用的路由算法,长期作为量子电路编译中的标准基线。
  • 药物设计:Hyra 生成了一种 PARP1 抑制剂候选物,在综合结合能力和成药性指标上优于已获批准的药物 olaparib。olaparib 由 AstraZeneca 和 Merck 以 Lynparza 品牌销售,用于治疗某些乳腺癌、卵巢癌和胰腺癌。腾讯强调,这一结果来自早期模拟,仍需进一步验证。
  • 游戏 AI:一个 Othello 机器人在 Botzone 的 730 个参赛项目中获得第三名,它通过自我对弈从 minimax 搜索演化为混合 AlphaZero 风格方法,呼应了 DeepMind 的 AlphaZero 所开创的自我对弈方法。
  • 3D 建模:该系统根据 2D 参考图像生成 3D 模型,并使用视觉语言模型评分标准进行评估。
  • 音乐:多乐器音乐编配通过七轮基于和声、节奏和审美标准的评估器演化得到优化。

未来展望

腾讯将 Hyra 描述为更广泛演化循环的基础:改进后的脚手架产生更高质量的数据和经验,从而带来更强的模型,而这些模型又进一步增强未来的脚手架。该公司表示,其 Hunyuan 模型家族的后续世代——即腾讯自研的大语言模型和多模态模型——将与 Hyra 框架共同演化,并邀请研究人员通过开放表单就学术合作、实习和反馈进行协作。