本文通过 VibeLifeBench 和 VibeSearchBench 揭示当前 AI 模型在真实生活任务中的主动性、持久化和长程一致性严重不足,尽管基准分数高涨。
📝 详细摘要
文章介绍了小红书 dots 团队提出的两个基准:VibeLifeBench 模拟生活中的超长程、模糊需求和世界变化,VibeSearchBench 聚焦信息获取的模糊交互过程。通过在真实生活场景(如为父母规划日本旅行)中测试七种顶尖模型,发现没有一个模型能在关键时间点主动发现护照有效期不足、航班变更或钓鱼邮件等未被显式通知的事件;所有模型在主动性、持久化和长程一致性方面表现极差,最高分仅 0.325 F1,且表现极不稳定。文章进一步分析了生活任务的四大特点(模糊、个性化、超长程、难验证),指出现有基准几乎全部建立在用户会明确表达需求、一次交互即可结束、世界静止的错误假设上,导致评测与实际使用脱节。最后强调,当前模型仍是“被叫醒才干活”的响应式系统,而非真正能常驻、可信的生活代理。
💡 主要观点
- VibeLifeBench 和 VibeSearchBench 揭示了现有 Agent 基准的三项虚假假设。 分别是用户会把需求说清楚、一次交互即可结束、世界是静态的,而真实生活与此完全相反。
💬 文章金句
- 没有一个在正确的时间点把妈妈的护照问题捞出来。
- 没有一个模型是稳的。所有模型的 min@3 都不超过 0.22。
- 主动性一栏全线 0.18--0.32,是所有维度里最弱的。
- 把 check 按它在时间线上的位置归一化后画出来,每个模型的通过率都在往下掉。
- 今天的模型是‘被叫醒才干活’的 responder,还不是能常驻的 agent。
📊 文章信息
AI 初评:85
来源:小红书技术REDtech
作者:小红书技术REDtech
分类:人工智能
语言:中文
阅读时间:25 分钟
字数:6060
标签: 人工智能, Agent基准, VibeLifeBench, VibeSearchBench, 大模型