📌 一句话摘要 本文介绍由中国信通院推出、无问芯穹技术支持的首个 AI Infra 运维智能体评测基准 AISHPerf,基于真实生产数据开源评估框架与配套故障模拟器。 📝 详细摘要 文章详细介绍了 AISHPerf-智算运维智能体评测基准的设计背景、数据来源、技术栈覆盖、开放式评测模式、配套混沌工程工具 AIops-Chaos 以及多维度评估体系。基准来源于无问芯穹近百亿条真实运维数据,精选 103 条高质量用例,覆盖宿主机、GPU、容器、训推脚本等多层栈问题,并提供故障模拟器和评测框架。实测显示当前主流模型得分均低于 50 分但时效性大幅提升,文章总结出稳定性不足、推理链质量差、决策不
📌 一句话摘要
本文介绍由中国信通院推出、无问芯穹技术支持的首个 AI Infra 运维智能体评测基准 AISHPerf,基于真实生产数据开源评估框架与配套故障模拟器。
📝 详细摘要
文章详细介绍了 AISHPerf-智算运维智能体评测基准的设计背景、数据来源、技术栈覆盖、开放式评测模式、配套混沌工程工具 AIops-Chaos 以及多维度评估体系。基准来源于无问芯穹近百亿条真实运维数据,精选 103 条高质量用例,覆盖宿主机、GPU、容器、训推脚本等多层栈问题,并提供故障模拟器和评测框架。实测显示当前主流模型得分均低于 50 分但时效性大幅提升,文章总结出稳定性不足、推理链质量差、决策不安全等典型失败模式,并展望了未来在数据丰富、工具完善和国产芯片适配方面的持续开源共建。
💡 主要观点
-
运维智能体评测需从知识问答转向实操考核,关注端到端问题解决能力。
基准不提供标准答案,只给现象和环境,要求智能体自主探索、排查和修复,更贴近生产实际。
基准基于真实生产场景数据,覆盖多种国产芯片和多技术栈故障。
数据来自无问芯穹近百亿条真实运维记录,筛选出 103 条用例,涵盖宿主机、GPU、容器、训推脚本等 5 大类和 22 个细分领域,支持天数、壁仞、沐曦、摩尔、昇腾 5 种国产芯片。
当前主流模型在复杂运维任务上正确率不足 50%,存在推理链脆弱等问题。
测试多种国内外模型,综合得分均低于 50 分;中等和困难题目正确率更低,模型在硬件故障上表现尤其差,倾向于反复确认。
配套混沌工程工具 AIops-Chaos 通过软件模拟硬件故障,低成本且可重复。
支持 GPU 掉卡、显存错误、NVLink 故障等典型异常注入,仅需一台 GPU 服务器即可构造多机故障现象,实现分钟级编排与恢复验证。
基准旨在成为公共基线,推动运维智能体能力的标准化评估。
不同团队可在同一套标准下验证能力、对齐认知,逐步积累最佳实践,同时面向国产芯片运维场景持续拓展。
💬 文章金句
- 当智能体走进 GPU 集群运维现场,真正难的不是回答问题,而是定位问题。
- 过去对模型的评估看重语言能力,而当 AI 进入基础设施领域后,'能否解决实际问题'已成为核心评判标准
📊 文章信息
AI 初评:86
来源:PaperWeekly
作者:PaperWeekly
分类:人工智能
语言:中文
阅读时间:22 分钟
字数:5483
标签:
AI Agent, GPU集群, 运维, AI Infra, 基准评测
阅读完整文章