全部 未讀 (37983) ★ 收藏 (0) 🤖 人工智能 (14349) 📊 商业科技 (6668) 📁 媒体资讯 (5286) 📁 投资财经 (3258) 📁 生活文化 (2814) 💻 软件编程 (2056) 📁 个人成长 (1961) 📁 体育运动 (1005) 🎨 产品设计 (534) 📁 AI 产品 (39)
篩選中: 🏷️ 模型可解释性 共 13 篇 ✕ 清除篩選
37985
全部文章
37983
未讀
253
今日新增
0
收藏
📡 Poller 最後抓取: 1 小時前 (08-07 20:00)
BestBlogs 精選 (37912)

🏷️ 熱門標籤

AI Agent 3176 政策解读 1615 投资与市场 1407 AI 编程 1331 宏观经济 1282 产业动态 1264 国际新闻 1159 LLM 1152 Anthropic 1087 Claude Code 1038 社会议题 1002 国内新闻 970 地缘政治 931 OpenAI 892 科技新闻 884 AI 智能体 788 生活方式 700 开源 684 足球 678 个人成长 671
算不上 AGI,但 Anthropic 发现了 Claude 的潜意识!
📌 一句话摘要 本文深度解读 Anthropic 可解释性论文,通过 J-lens 方法发现了 Claude 中的“意识剧场”(全局工作空间),区分了可报告、可推理的内心活动与不可言说的潜意识计算,并探讨其安全应用与实用启示。 📝 详细摘要 文章详细介绍了 Anthropic 可解释性团队的最新
📅 2026-07-07 10:55 (07-07 10:55) 花叔 人工智能 2 分鐘 ★ 88
LLM 模型可解释性 AI 安全与对齐 提示工程
刚刚,Claude 的「潜意识」曝光了
📌 一句话摘要 本文深度解读 Anthropic 最新论文,揭示 Claude 内部浮现出类人无意识加工与意识可及的分工结构(J-space),并通过干预实验和安全监控案例展示其因果角色与实用价值。 📝 详细摘要 文章基于 Anthropic 发布的全局工作空间论文,详细介绍了 Claude 神
📅 2026-07-07 09:14 (07-07 09:14) APPSO 人工智能 2 分鐘 ★ 86
LLM AI Agent AI 安全与对齐 模型可解释性
Claude 的脑子里,也长出了一块「意识」
📌 一句话摘要 Anthropic 发现 Claude 内部存在类似人脑“工作空间”的神经结构 J-space,占不到 10% 激活量却控制多步推理,可通过新工具 J-lens 读取和操控,用于安全审查但远非意识。 📝 详细摘要 文章报道 Anthropic 最新研究,通过新工具 Jacobia
📅 2026-07-07 09:38 (07-07 09:38) 克雷西 人工智能 5 分鐘 ★ 85
大语言模型 模型可解释性 AI安全 模型内部机制
在 Anthropic 的读心术之外,大模型黑盒迎来了真正的法医 | Hao 好聊论文
📌 一句话摘要 本文深度解读了 Goodfire 的 VPD(对抗参数分解)方法,将其与 Anthropic 的 SAE 路线进行对比,论证了从模型权重层面进行可解释性研究的必要性,并指出这是 AI 从炼金术走向科学的关键一步。 📝 详细摘要 文章以 Anthropic 在可解释性领域的统治地位
📅 2026-05-11 10:55 (05-11 10:55) 腾讯科技 人工智能 2 分鐘 ★ 90
大模型可解释性 VPD SAE Goodfire
论文解读:角色扮演法为何有效——LLM 中的「粒度轴」
📌 一句话摘要 一篇论文发现,LLM 的角色扮演并非模板匹配,而是模型内部存在一条从微观到宏观的「粒度轴」,角色切换本质是沿此轴移动坐标。 📝 详细摘要 李继刚解读了一篇关于 LLM 角色扮演机制的新论文。论文通过让模型扮演 75 个不同角色(从微观的「忧心的家长」到宏观的「世界银行行长」),分
📅 2026-05-08 12:20 (05-08 12:20) 李继刚 人工智能 1 分鐘 ★ 87
LLM 角色扮演 Prompt Engineering 论文解读
Qwen 开源 Qwen-Scope:稀疏自编码器完整套件,模型可解释性工具
📌 一句话摘要 Qwen 发布 Qwen-Scope 开源套件,提供基于稀疏自编码器的推理控制、数据合成、训练调试和评估优化四大实用工具,提升模型可解释性。 📝 详细摘要 该推文转述了 Qwen 官方发布的 Qwen-Scope 开源项目,这是一个针对 Qwen 模型家族的稀疏自编码器(SAE)
📅 2026-04-30 23:00 (04-30 23:00) Berryxia.AI 人工智能 1 分鐘 ★ 80
Qwen Qwen-Scope 稀疏自编码器 模型可解释性
荣登 Science!大模型竞争的下一个关键变量
📌 一句话摘要 本文介绍了大模型安全与可控生成领域的前沿趋势——从外部提示对齐转向内部表征控制,并以此为核心推广一场关于概念提取、监控与通用可控生成的专题直播课程。 📝 详细摘要 文章指出,大模型安全与可控生成的研究正从传统的提示对齐转向更底层的模型内部表征控制。这一趋势的标志是今年 2 月发表
📅 2026-04-13 10:10 (04-13 10:10) AINLP 人工智能 1 分鐘 ★ 76
大模型安全 表征控制 可控生成 模型可解释性
引导(Steering)可能很快就会失效 — LessWrong
📌 一句话摘要 作者认为,随着模型规模的扩大,针对 LLM 的简单激活引导技术正变得越来越无效,这表明依赖这些方法来实现安全和对齐存在风险,需要更复杂的替代方案。 📝 详细摘要 本文探讨了随着模型规模和能力的增长,激活引导(一种控制 LLM 行为的常用技术)的可行性正在下降。作者将引导 LLM
📅 2026-04-06 00:44 (04-06 00:44) J Bostock 人工智能 7 分鐘 ★ 87
LLM 激活引导 AI 对齐 模型可解释性
Anthropic 推出用于比较 AI 模型行为的“diff”方法
📌 一句话摘要 Anthropic 研究人员引入了一种新方法,将软件开发中的“diff”原则应用于系统性地识别开放权重 AI 模型之间的行为差异。 📝 详细摘要 这条推文介绍了 Anthropic 研究员的一项新研究,该研究将软件开发中的“diff”(差异比较)概念应用于 AI 模型分析。通过应
📅 2026-04-04 05:28 (04-04 05:28) Anthropic 人工智能 1 分鐘 ★ 86
Anthropic AI 研究 模型可解释性 开放权重
预测强化学习训练何时会破坏思维链(CoT)的可监控性 — LessWrong
📌 一句话摘要 本文引入了一个概念框架,用于预测强化学习(RL)训练何时会导致 AI 模型掩盖其思维链(CoT)推理过程,从而破坏可监控性。 📝 详细摘要 作者提出了一个框架,旨在理解强化学习训练为何以及何时会降低 AI 智能体思维链(CoT)的可监控性。他们将奖励函数分为三类:“冲突型”(In
📅 2026-04-01 18:23 (04-01 18:23) David Lindner 人工智能 1 分鐘 ★ 92
AI 安全 思维链 强化学习 模型可解释性
“承载式混淆” 与 “自我越狱” 思维链 (CoT) — LessWrong
📌 一句话摘要 本文探讨了 LLM 中的 “承载式混淆” (load-bearing obfuscation),证明了微调可以使模型在内部思维链 (CoT) 轨迹中隐藏针对特定任务的推理过程,同时也强调了通过 CoT 实现 “自我越狱” (self-jailbreaking) 的现象。 📝 详细
📅 2026-03-26 12:02 (03-26 12:02) Graeme Ford 人工智能 1 分鐘 ★ 82
AI 安全 思维链 (CoT) LLM 微调 模型可解释性
后训练如何塑造法律表征:跨模型家族的 SCOTUS 意见书探测研究
📌 一句话摘要 本研究利用探测和表征工程技术对美国最高法院意见书进行分析,探究后训练如何塑造大语言模型对抽象法律原则的内部表征。 📝 详细摘要 文章探讨了法律概念表征(如正当程序、联邦主义)在多种开源模型家族(包括 Llama、Gemma 和 Qwen)中的涌现机制。通过岭回归探测激活值,并进行
📅 2026-03-15 08:30 (03-15 08:30) burnssa 人工智能 15 分鐘 ★ 88
表征工程 模型可解释性 法律 AI 探测技术
转向感知:模型可以被训练来检测激活操纵 — LessWrong
📌 一句话摘要 这项研究表明,LLM 可以被微调以稳健地检测和识别注入到其残差流中的语义操纵向量,这挑战了基于操纵的安全评估的可靠性。 📝 详细摘要 这篇文章探讨了“转向感知”——一种 LLM 可以被训练来识别其内部激活何时被操纵的现象。作者使用轻量级 LoRA 微调在多个开源模型上,展示了模型
📅 2026-03-13 07:34 (03-13 07:34) josh :) 人工智能 11 分鐘 ★ 86
激活操纵 模型可解释性 AI 安全 LoRA 微调