收录解读
数学研究历来被认为是人类智识的核心领域之一,形式化证明的构造需要深刻的直觉与推理能力。FirstProof 挑战于2026年2月发布,包含10道来自职业数学家真实研究的问题,要求AI在8天内自主生成达到发表标准的证明,没有任何人类数学输入的辅助。这是目前已知的首批针对"研究级别"数学问题的自主AI评测之一。
Aletheia 以 Gemini 3 Deep Think 为基础模型,采用"生成—验证—筛选"流水线:直接读入原始LaTeX题目,生成候选解答后通过预设验证提示过滤,无法求解时主动输出"未找到解"以保证可靠性。论文同时运行了两个配置(Aletheia A 和 B),通过 best-of-2 策略超越单个智能体的表现,并详细记录了每道题目的推理成本。在10道研究级数学题中,Aletheia 成功解决了6道(涵盖表示论、同伦论、代数几何等方向),且论文完整公开了提示词与输出,体现了高度的透明度。
该工作是迄今最具说服力的自主数学研究智能体实证之一,证明了AI系统已能在有限时间内对真实研究级别问题产出专家认可的形式证明。对于本仓库关注的"智能体与自主科学"方向,这一结果标志着从辅助数学工具向真正自主数学研究的范式转变,具有里程碑意义。同时论文严格的透明度实践(公开原始提示与输出)也为该领域的评测规范树立了参照。
论文的主要局限在于覆盖范围仍然有限:10道题中有4道完全未能产出解答,且成功率高度依赖底层基础模型(Gemini 3 Deep Think)的能力,独立可复现性受限于闭源模型。此外,该工作更接近于竞赛报告而非完整的系统论文,缺少对智能体架构的深入分析与消融实验,难以清晰区分系统设计与模型能力各自的贡献。
原始摘要
We report the performance of Aletheia (Feng et al., 2026b), a mathematics research agent powered by Gemini 3 Deep Think, on the inaugural FirstProof challenge. Within the allowed timeframe of the challenge, Aletheia autonomously solved 6 problems (2, 5, 7, 8, 9, 10) out of 10 according to majority expert assessments; we note that experts were not unanimous on Problem 8 (only). For full transparency, we explain our interpretation of FirstProof and disclose details about our experiments as well as our evaluation. Raw prompts and outputs are available at https://github.com/google-deepmind/superhuman/tree/main/aletheia.