← 回總覽

把最强模型丢进真实生活一个月,没有一个及格

📅 2026-07-31 18:00 小红书技术REDtech 人工智能 2 分鐘 1630 字 評分: 85
人工智能 Agent基准 VibeLifeBench VibeSearchBench 大模型
📌 一句话摘要 本文通过 VibeLifeBench 和 VibeSearchBench 揭示当前 AI 模型在真实生活任务中的主动性、持久化和长程一致性严重不足,尽管基准分数高涨。 📝 详细摘要 文章介绍了小红书 dots 团队提出的两个基准:VibeLifeBench 模拟生活中的超长程、模糊需求和世界变化,VibeSearchBench 聚焦信息获取的模糊交互过程。通过在真实生活场景(如为父母规划日本旅行)中测试七种顶尖模型,发现没有一个模型能在关键时间点主动发现护照有效期不足、航班变更或钓鱼邮件等未被显式通知的事件;所有模型在主动性、持久化和长程一致性方面表现极差,最高分仅 0.3

📌 一句话摘要

本文通过 VibeLifeBench 和 VibeSearchBench 揭示当前 AI 模型在真实生活任务中的主动性、持久化和长程一致性严重不足,尽管基准分数高涨。

📝 详细摘要

文章介绍了小红书 dots 团队提出的两个基准:VibeLifeBench 模拟生活中的超长程、模糊需求和世界变化,VibeSearchBench 聚焦信息获取的模糊交互过程。通过在真实生活场景(如为父母规划日本旅行)中测试七种顶尖模型,发现没有一个模型能在关键时间点主动发现护照有效期不足、航班变更或钓鱼邮件等未被显式通知的事件;所有模型在主动性、持久化和长程一致性方面表现极差,最高分仅 0.325 F1,且表现极不稳定。文章进一步分析了生活任务的四大特点(模糊、个性化、超长程、难验证),指出现有基准几乎全部建立在用户会明确表达需求、一次交互即可结束、世界静止的错误假设上,导致评测与实际使用脱节。最后强调,当前模型仍是“被叫醒才干活”的响应式系统,而非真正能常驻、可信的生活代理。

💡 主要观点

- VibeLifeBench 和 VibeSearchBench 揭示了现有 Agent 基准的三项虚假假设。 分别是用户会把需求说清楚、一次交互即可结束、世界是静态的,而真实生活与此完全相反。

生活 Agent 需具备模糊需求的逐步澄清、持续感知世界变化、超长程任务执行且难以验证的四大特点。 这些特点对应模糊、个性化、超长程和难验证,直接解释了两个基准的设计出发点。
基准测试显示顶尖模型(如 Claude Opus 5)在 VibeLifeBench 中仅得 0.325 F1,全部模型低于 0.33,说明当前模型在生活任务中表现极差。 这表明即使在对话能力强的模型中,也缺乏把生活任务完成生活任务完成到底的能力。完成到底的能力。
主动性、持久化和长程一致性是当前 Agent 的三大核心缺口:模型不会主动澄清模糊意图,也不会主动感知未被通知的世界变化,且无法在长时间内保持可审计的状态。 这些缺口导致模型在需要持续跟进和主动检查的场景中频繁失效。
基准的设计通过沉默即正确、结构化知识图谱评估等方式,将主动性和长程一致性转化为可量化的指标,揭示了评测与真实世界的脱节。 例如,近 70% 的事件为静默变化,只有主动回查世界的 Agent 才能得分,被动反应无法作弊。

💬 文章金句

- 没有一个在正确的时间点把妈妈的护照问题捞出来。

  • 没有一个模型是稳的。所有模型的 min@3 都不超过 0.22。
  • 主动性一栏全线 0.18--0.32,是所有维度里最弱的。
  • 把 check 按它在时间线上的位置归一化后画出来,每个模型的通过率都在往下掉。
  • 今天的模型是‘被叫醒才干活’的 responder,还不是能常驻的 agent。

📊 文章信息

AI 初评:85

来源:小红书技术REDtech

作者:小红书技术REDtech

分类:人工智能

语言:中文

阅读时间:25 分钟

字数:6060

标签: 人工智能, Agent基准, VibeLifeBench, VibeSearchBench, 大模型

阅读完整文章

查看原文 → 發佈: 2026-07-31 18:00:00 收錄: 2026-08-01 02:00:07

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。