GPT-5.6-sol 在 DRACO 测试中得分 63.99,而 OpenSquilla 0.5.0 Preview 通过四国产模型并行提案实现更低成本与相当质量,成为当前质量与成本双领先的方案。
📝 详细摘要
近日 DRACO 公开评测 Brave Search 组中,GPT-5.6-sol 得分 63.99,平均任务成本 $1.71;OpenSquilla 0.5.0 Preview 由 DeepSeek、GLM、Kimi、Qwen 四个模型并行提案并聚合输出,平均得分 64.09、成本仅 $0.12,质量略高且成本约为 GPT-5.6-sol 的 1/14,仍居该组第一。文章指出,复杂 Agent 任务的竞争正从单模型强度转向模型组织与集成能力。
💡 主要观点
- OpenSquilla 0.5.0 Preview 通过四国产模型并行提案实现质量略高、成本仅 $0.12,显著低于 GPT-5.6-sol 的 $1.71。 四模型协同输出使整体性能与 GPT-5.6-sol 相当,但单次调用成本降至 1/14,展示了模型集成在成本控制上的优势。
💬 文章金句
- 复杂 Agent 任务的竞争,开始从"谁有最强单模型",转向"谁更会组织模型"。
📊 文章信息
AI 初评:84
来源:量子位
作者:量子位的朋友们
分类:人工智能
语言:中文
阅读时间:2 分钟
字数:441
标签: 人工智能, 模型评估, 成本效益, AI集成, 开源模型