火山引擎开源 SearchCLI,提出 Agent 驱动的搜索自迭代闭环与 SPA 策略优化框架,在三个业务数据集上实现 NDCG@20 提升 11.66%~13.50%。
📝 详细摘要
文章介绍火山引擎开源的 SearchCLI 项目,核心是「Agent 驱动的搜索自迭代」能力。传统搜索调优依赖专家反复试验,参数之间相互影响且评测成本高。作者将搜索调优拆解为「发现问题—提出假设—分配评测预算—筛选候选—验证收益—输出候选配置」的可审阅闭环,由 Agent 调度 Skills 与 CLI 完成 Query 校验、实验规划、批量搜索、相关性标注、指标计算与候选 Scene 创建。算法层提出 SPA(Strategy Population Annealing)框架,将搜索参数编码为带领域语义的 Genome,通过多保真评测、多视角 Elite、语义化进化与退火机制分配预算,并以 RobustScore 综合 NDCG、MRR、零结果率、延迟、Query 类型方差与置信区间宽度选出稳定策略。工程层沉淀 Plan 预算编译、受控并发、标签缓存与 Checkpoint/Resume 四类能力,保证长任务可复现完成。在服饰商品、综合商品与图片内容三个数据集上,自动调优策略相较默认策略 NDCG@20 提升 11.66%~13.50%,Precision@10 最高提升 21.17%。
💡 主要观点
- 搜索调优的核心矛盾是参数相互影响与评测成本高。 召回模式、关键词/语义权重、匹配门槛与候选规模彼此耦合,单点修改难以判断整体收益;专家反复试验难以低成本、可复现地持续。
💬 文章金句
- 会调用搜索,只是 Agent 搜索能力的第一步。更难的是:当结果不好时,它能不能找到改进方向,并通过一轮轮实验把搜索变好?
- 「自迭代」不是让 Agent 绕过控制、直接修改线上策略,而是把「发现问题—提出假设—分配评测预算—筛选候选—验证收益—输出候选配置」变成一套可以重复运行、结果可以审阅的闭环。
- 搜索调优看起来像参数优化,实质上却是一个评测成本高、反馈有噪声、参数存在约束、结果还必须可解释和可落地的实验设计问题。
- 完整 SPA 要找的不是一次实验中的最高分,而是在 Query 分布和 Judge 噪声下仍然稳定的策略。
📊 文章信息
AI 初评:88
来源:字节跳动技术团队
作者:字节跳动技术团队
分类:人工智能
语言:中文
阅读时间:18 分钟
字数:4411
标签: AI Agent, AI 编程, 开源项目, 搜索与推荐, LLM