← 回總覽

直击 GPU 集群真实故障,首个 AI Infra 运维智能体基准开源

📅 2026-06-29 19:02 PaperWeekly 人工智能 2 分鐘 1364 字 評分: 86
AI Agent GPU集群 运维 AI Infra 基准评测
📌 一句话摘要 本文介绍由中国信通院推出、无问芯穹技术支持的首个 AI Infra 运维智能体评测基准 AISHPerf,基于真实生产数据开源评估框架与配套故障模拟器。 📝 详细摘要 文章详细介绍了 AISHPerf-智算运维智能体评测基准的设计背景、数据来源、技术栈覆盖、开放式评测模式、配套混沌工程工具 AIops-Chaos 以及多维度评估体系。基准来源于无问芯穹近百亿条真实运维数据,精选 103 条高质量用例,覆盖宿主机、GPU、容器、训推脚本等多层栈问题,并提供故障模拟器和评测框架。实测显示当前主流模型得分均低于 50 分但时效性大幅提升,文章总结出稳定性不足、推理链质量差、决策不

📌 一句话摘要

本文介绍由中国信通院推出、无问芯穹技术支持的首个 AI Infra 运维智能体评测基准 AISHPerf,基于真实生产数据开源评估框架与配套故障模拟器。

📝 详细摘要

文章详细介绍了 AISHPerf-智算运维智能体评测基准的设计背景、数据来源、技术栈覆盖、开放式评测模式、配套混沌工程工具 AIops-Chaos 以及多维度评估体系。基准来源于无问芯穹近百亿条真实运维数据,精选 103 条高质量用例,覆盖宿主机、GPU、容器、训推脚本等多层栈问题,并提供故障模拟器和评测框架。实测显示当前主流模型得分均低于 50 分但时效性大幅提升,文章总结出稳定性不足、推理链质量差、决策不安全等典型失败模式,并展望了未来在数据丰富、工具完善和国产芯片适配方面的持续开源共建。

💡 主要观点

- 运维智能体评测需从知识问答转向实操考核,关注端到端问题解决能力。 基准不提供标准答案,只给现象和环境,要求智能体自主探索、排查和修复,更贴近生产实际。

基准基于真实生产场景数据,覆盖多种国产芯片和多技术栈故障。 数据来自无问芯穹近百亿条真实运维记录,筛选出 103 条用例,涵盖宿主机、GPU、容器、训推脚本等 5 大类和 22 个细分领域,支持天数、壁仞、沐曦、摩尔、昇腾 5 种国产芯片。
当前主流模型在复杂运维任务上正确率不足 50%,存在推理链脆弱等问题。 测试多种国内外模型,综合得分均低于 50 分;中等和困难题目正确率更低,模型在硬件故障上表现尤其差,倾向于反复确认。
配套混沌工程工具 AIops-Chaos 通过软件模拟硬件故障,低成本且可重复。 支持 GPU 掉卡、显存错误、NVLink 故障等典型异常注入,仅需一台 GPU 服务器即可构造多机故障现象,实现分钟级编排与恢复验证。
基准旨在成为公共基线,推动运维智能体能力的标准化评估。 不同团队可在同一套标准下验证能力、对齐认知,逐步积累最佳实践,同时面向国产芯片运维场景持续拓展。

💬 文章金句

- 当智能体走进 GPU 集群运维现场,真正难的不是回答问题,而是定位问题。

  • 过去对模型的评估看重语言能力,而当 AI 进入基础设施领域后,'能否解决实际问题'已成为核心评判标准

📊 文章信息

AI 初评:86

来源:PaperWeekly

作者:PaperWeekly

分类:人工智能

语言:中文

阅读时间:22 分钟

字数:5483

标签: AI Agent, GPU集群, 运维, AI Infra, 基准评测

阅读完整文章

查看原文 → 發佈: 2026-06-29 19:02:00 收錄: 2026-06-29 22:00:50

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。