← 回總覽

大模型能写出工业级优化算法吗?MIT 提出 FrontierOR 给 AI 设下考场

📅 2026-07-10 13:37 新智元 人工智能 2 分鐘 1750 字 評分: 85
LLM 模型评测与基准 运筹优化 算法设计 AI Agent
📌 一句话摘要 MIT 提出 FrontierOR 基准,系统评测大模型能否像运筹工程师一样设计可扩展、高质量的大规模优化算法,结果显示前沿模型在可执行性上已接近上限,但在解质量和效率上仍远未达标,自演化框架可将最难题的 QTE 从 0.15 提升至 0.50。 📝 详细摘要 文章详细介绍 MIT 等机构提出的 FrontierOR 基准,旨在评估 LLM 设计工业级优化算法的能力。FrontierOR 从 20 余家 OR 期刊的 180 篇论文中筛选真实问题,转化为标准化评测任务,并精选 50 个 Hard 子集。评测采用两段式:小实例预筛可执行性与可行性,大实例评估解质量与速度(QT

📌 一句话摘要

MIT 提出 FrontierOR 基准,系统评测大模型能否像运筹工程师一样设计可扩展、高质量的大规模优化算法,结果显示前沿模型在可执行性上已接近上限,但在解质量和效率上仍远未达标,自演化框架可将最难题的 QTE 从 0.15 提升至 0.50。

📝 详细摘要

文章详细介绍 MIT 等机构提出的 FrontierOR 基准,旨在评估 LLM 设计工业级优化算法的能力。FrontierOR 从 20 余家 OR 期刊的 180 篇论文中筛选真实问题,转化为标准化评测任务,并精选 50 个 Hard 子集。评测采用两段式:小实例预筛可执行性与可行性,大实例评估解质量与速度(QTE)。One-shot 结果显示,前沿模型可执行性达 0.93-0.98,但 QTE 仅 0.25-0.31,Hard 子集下降更明显。方法分析表明,弱模型高度依赖纯求解器调用,强模型更倾向分解、启发式与混合策略。自演化框架(CORAL、OpenEvolve、EoH)可将最难题的 QTE 从 0.15 提升至 0.50,其中速度提升容易,解质量提升更难。文章展望了构建算法技能库、提升 verifier 能力、融合 LLM 与传统优化器等方向,认为 FrontierOR 将评估重心从「会不会建模」推进到「会不会设计算法」。

💡 主要观点

- FrontierOR 将 LLM 优化能力评估从「建模」推向「算法设计」。 传统基准只考察能否写数学模型或调用求解器,FrontierOR 直接使用真实 OR 论文中的工业级问题,要求模型设计可扩展、高质量的专用算法,并与 Gurobi baseline 对比。

前沿模型可执行性接近上限,但解质量与效率仍是瓶颈。 在 one-shot 评测中,最强模型 Execution rate 达 0.98,但 QTE 仅 0.25-0.31,说明代码能跑通不代表能在工业规模上求解高效。Hard 子集进一步拉大差距,Claude Opus 4.6 的 QTE 达 0.32,而 GPT-5.3-Codex 降至 0.18。
方法多样性是竞争力的关键。 弱模型约 99% 的程序为纯求解器调用,强模型更多使用分解、局部搜索和数学规划-启发式混合方法,这些非纯求解器方法在 QTE 上整体更有优势。
自演化框架可显著提升算法质量,但解质量提升比速度更难。 CORAL、OpenEvolve 等框架通过多轮迭代测试,将最难题的 QTE 从 0.15 提升至 0.50。速度在 5 次尝试内即可超越 Gurobi,但接近全局最优需要更精细的邻域和修复策略。

💬 文章金句

- FrontierOR 直接把模型推向真实 OR 论文里的工业级问题,考的是它能不能像算法工程师一样发现结构、设计算法,并在大实例上与 Gurobi baseline 进行比较。

  • 大模型已经能写出形式上完整的优化程序,但要让这段程序在工业级规模上保持可行、接近最优,并且比 Gurobi 更快,仍然困难。
  • 如果说前一阶段的 LLM-for-OR 研究回答的是「大模型会不会建模」,那么 FrontierOR 开始追问一个更难也更现实的问题:大模型能不能成为真正的算法设计者?

📊 文章信息

AI 初评:85

来源:新智元

作者:新智元

分类:人工智能

语言:中文

阅读时间:21 分钟

字数:5107

标签: LLM, 模型评测与基准, 运筹优化, 算法设计, AI Agent

阅读完整文章

查看原文 → 發佈: 2026-07-10 13:37:00 收錄: 2026-07-10 20:00:23

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。