← 回總覽

GPT-5.6-sol 入榜 DRACO:OpenSquilla 集成方案仍在 Brave 组质量、成本双领先

📅 2026-07-14 13:13 量子位的朋友们 人工智能 1 分鐘 1106 字 評分: 84
人工智能 模型评估 成本效益 AI集成 开源模型
📌 一句话摘要 GPT-5.6-sol 在 DRACO 测试中得分 63.99,而 OpenSquilla 0.5.0 Preview 通过四国产模型并行提案实现更低成本与相当质量,成为当前质量与成本双领先的方案。 📝 详细摘要 近日 DRACO 公开评测 Brave Search 组中,GPT-5.6-sol 得分 63.99,平均任务成本 $1.71;OpenSquilla 0.5.0 Preview 由 DeepSeek、GLM、Kimi、Qwen 四个模型并行提案并聚合输出,平均得分 64.09、成本仅 $0.12,质量略高且成本约为 GPT-5.6-sol 的 1/14,仍居该组

📌 一句话摘要

GPT-5.6-sol 在 DRACO 测试中得分 63.99,而 OpenSquilla 0.5.0 Preview 通过四国产模型并行提案实现更低成本与相当质量,成为当前质量与成本双领先的方案。

📝 详细摘要

近日 DRACO 公开评测 Brave Search 组中,GPT-5.6-sol 得分 63.99,平均任务成本 $1.71;OpenSquilla 0.5.0 Preview 由 DeepSeek、GLM、Kimi、Qwen 四个模型并行提案并聚合输出,平均得分 64.09、成本仅 $0.12,质量略高且成本约为 GPT-5.6-sol 的 1/14,仍居该组第一。文章指出,复杂 Agent 任务的竞争正从单模型强度转向模型组织与集成能力。

💡 主要观点

- OpenSquilla 0.5.0 Preview 通过四国产模型并行提案实现质量略高、成本仅 $0.12,显著低于 GPT-5.6-sol 的 $1.71。 四模型协同输出使整体性能与 GPT-5.6-sol 相当,但单次调用成本降至 1/14,展示了模型集成在成本控制上的优势。

评测显示,质量分与 GPT-5.6-sol 基本持平,且在平均得分上略高 0.10 分。 这表明在相似质量水平下,组合策略能够保持或提升整体表现,验证了多模型集成的有效性。
文章指出,复杂 Agent 任务的竞争正从"谁有最强单模型"转向"谁更会组织模型"。 这标志着 AI 研发的新趋势,强调了组织、调度与集成能力在实际应用中的关键价值。

💬 文章金句

- 复杂 Agent 任务的竞争,开始从"谁有最强单模型",转向"谁更会组织模型"。

📊 文章信息

AI 初评:84

来源:量子位

作者:量子位的朋友们

分类:人工智能

语言:中文

阅读时间:2 分钟

字数:441

标签: 人工智能, 模型评估, 成本效益, AI集成, 开源模型

阅读完整文章

查看原文 → 發佈: 2026-07-14 13:13:56 收錄: 2026-07-14 22:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。