本文指出 llama.cpp 在处理混合模型(如 Qwen3.6-27B)时存在 checkpoint 缓存恢复逻辑缺陷,导致每次对话都需要重新 prefill 全部上下文,严重拖慢推理速度。
📝 详细摘要
文章基于 GitHub Issue 报告,揭示了 llama.cpp 在支持混合模型(如 Qwen3.6-27B,结合了 Mamba 等循环结构)时的一个严重性能 bug。核心问题是 checkpoint 的巡回(restore)逻辑对这类模型无效,导致系统无法正确复用历史对话的 KV 缓存。这意味着每次用户发起新请求时,模型都需要从头开始 prefill 整个对话历史,而非仅处理新增的 token。文章引用实测数据,显示在 50K 上下文长度下,每次请求会浪费约 40 秒进行全量 reprocess。作者指出,该问题在 Agent 工具调用等需要多轮交互的场景下,使得该组合的性能不可用。该 Issue 目前仍为开放状态。
💡 主要观点
- llama.cpp 的 checkpoint 恢复逻辑对混合模型无效。 由于缓存巡回逻辑的缺陷,系统无法正确识别和复用之前对话的 checkpoint,导致每次请求都需要重新 prefill 整个上下文。
💬 文章金句
- 翻译成大白话讲,就是你对一个人,每多说一句话,就要从第一句开始重复一遍。
- 目前的 llama.cpp+qwen3.6-27B 这个组合,在 Agent 工具这个场景下,性能不可用。
📊 文章信息
AI 初评:80
来源:V2EX
作者:sentinelK
分类:软件编程
语言:中文
阅读时间:2 分钟
字数:367
标签: LLM, llama.cpp, 性能优化, 开源项目, 模型推理