让 AI 像育种一样进化算法,会发生什么?
TL;DR
让大模型提出许多程序,再由自动评测器运行、打分、筛选和继续改良,算法发现就像进入了一座高速育种场。本文拆解 AlphaEvolve 的循环,说明它为何适合答案可验证的问题,也解释它不能自动解决哪些开放难题。
让大模型提出许多程序,再由自动评测器运行、打分、筛选和继续改良,算法发现就像进入了一座高速育种场。本文拆解 AlphaEvolve 的循环,说明它为何适合答案可验证的问题,也解释它不能自动解决哪些开放难题。

传统软件开发通常从人写算法开始,计算机负责忠实执行。现在出现了一种反过来的流程:大模型不断提出程序,计算机负责运行和打分,表现较好的程序再成为下一轮改良的“亲本”。算法设计于是像进入了一座高速育种场。
Google DeepMind 在 2025 年公布的 AlphaEvolve就是这种思路的代表。它把语言模型的提案能力、自动评测器和进化搜索组合起来,用于寻找与优化算法。
一轮“进化”是怎样发生的
首先,系统准备问题说明、现有程序和评测标准。多个语言模型据此提出代码改动,有的只调一个局部,有的尝试完全不同的策略。
接着,自动评测器编译或运行候选程序,检查正确性,并根据速度、内存、解题质量等指标打分。结果进入程序数据库,选择机制保留有潜力的候选,下一轮提示再从这些候选出发继续变异和组合。
这与生物进化并不完全相同:候选不是随机 DNA,筛选标准也由人明确设计。但“产生变化—接受环境检验—保留优秀结果—继续迭代”的循环非常相似。
为什么评测器比模型更关键
语言模型可以快速制造许多看似合理的代码,却不能仅凭自我评价保证正确。真正让搜索向前推进的,是独立、可重复的评测器。数学答案可以代入验证,调度算法可以在模拟器里测试,代码可以通过测试套件并测量运行时间。
如果目标是“写一篇最感人的小说”,机器很难给出公认分数;如果目标是“在答案正确的前提下减少矩阵乘法次数”,评测就清晰得多。因此,AlphaEvolve 最适合结果能够自动验证、指标能够量化的问题。
DeepMind 报告它被用于数据中心、芯片设计、AI 训练和矩阵乘法算法等方向。2026 年发布的后续案例还展示了基因测序纠错、电网优化与量子电路等应用。这些结果说明同一搜索框架可以跨领域工作,但每个领域仍需要专家定义问题、约束和验证方式。
“进化出来”不代表可以直接上线
自动评分可能存在漏洞。候选程序有时会钻评测规则的空子:测试用例覆盖不全,它就只对已知案例有效;只测平均速度,它可能牺牲最坏情况;模拟器与现实有差距,优化结果可能无法落地。
因此最终候选还要经过独立测试、代码审查、理论分析和真实环境验证。系统搜索到的是满足当前评测标准的高分方案,不是自动获得了“正确且安全”的印章。
计算成本也是边界。一次进化搜索可能生成并运行大量候选,只有当改进价值足够高、评测足够便宜时才划算。没有明确指标的问题,盲目增加搜索规模只会制造更多代码。
人类角色从写答案变成设计赛场
这类系统不会让问题定义消失,反而放大其重要性。人要决定什么值得优化、哪些约束不能违反、怎样防止投机,以及一个高分结果是否具有现实意义。
算法“育种”最令人兴奋的地方,不是 AI 能一夜之间替代数学家和工程师,而是它能在清晰赛场里探索远超人力的候选数量。模型负责想出变化,机器负责严格筛选,专家负责确保赛场本身没有选错方向。三者结合,才可能把一次有趣的代码突变变成真正的新算法。



