全部 未讀 (37696) ★ 收藏 (0) 🤖 人工智能 (14295) 📊 商业科技 (6633) 📁 媒体资讯 (5216) 📁 投资财经 (3201) 📁 生活文化 (2769) 💻 软件编程 (2050) 📁 个人成长 (1954) 📁 体育运动 (995) 🎨 产品设计 (531) 📁 AI 产品 (39)
篩選中: 🏷️ Mamba 共 13 篇 ✕ 清除篩選
37698
全部文章
37696
未讀
206
今日新增
0
收藏
📡 Poller 最後抓取: 58 分鐘前 (08-06 20:00)
BestBlogs 精選 (37625)

🏷️ 熱門標籤

AI Agent 3158 政策解读 1593 投资与市场 1383 AI 编程 1326 宏观经济 1264 产业动态 1249 国际新闻 1150 LLM 1147 Anthropic 1087 Claude Code 1038 社会议题 983 国内新闻 958 地缘政治 924 OpenAI 891 科技新闻 879 AI 智能体 788 生活方式 688 开源 683 足球 671 个人成长 661
探讨大模型参数规模增长与 Gated Delta Networks 架构
📌 一句话摘要 作者分析近期大模型参数量突破 T 级且质量提升的原因,重点关注 Gated Delta Networks 及 Mamba 相关的混合架构。 📝 详细摘要 作者通过阅读论文发现 Gated Delta Networks(基于 Mamba 思想)可能是近期大模型(如英伟达 Nemot
📅 2026-07-21 12:19 (16 天前) 向阳乔木 人工智能 1 分鐘 ★ 76
模型架构 Gated Delta Networks Mamba LLM
NVIDIA Nemotron 3 Nano Omni 详细解读:架构、基准与开源
📌 一句话摘要 BestBlogs 详细解读了 NVIDIA Nemotron 3 Nano Omni 的架构创新、基准测试表现和开源情况。 📝 详细摘要 这是对 NVIDIA Nemotron 3 Nano Omni 模型的详细解读推文,作为上一条推文的 Thread 后续。内容基于 Hugg
📅 2026-04-29 08:44 (04-29 08:44) 人工智能 1 分鐘 ★ 82
NVIDIA Nemotron 多模态模型 Mamba
Transformer 可以改装成 Mamba 了:苹果把推理成本直接打成线性
📌 一句话摘要 苹果提出一种两阶段蒸馏方法,将 Transformer 模型转换为 Mamba 架构,在仅使用 2.7% 训练数据的情况下,使 1B 参数模型的困惑度从 14.89 恢复至 14.11,逼近教师模型的 13.86,实现了推理成本从平方级到线性的转变。 📝 详细摘要 本文介绍了苹果
📅 2026-04-22 11:30 (04-22 11:30) 机器之心 人工智能 2 分鐘 ★ 88
Transformer Mamba 模型蒸馏 线性注意力
苹果研究:通过线性化注意力中间体实现 Transformer 到 Mamba SSM 的跨架构蒸馏
📌 一句话摘要 苹果的研究展示了如何通过一个线性化注意力中间体,将 Transformer 模型蒸馏成 Mamba 状态空间模型,并取得更优的困惑度。 📝 详细摘要 这条推文详细解读了苹果公司的一项研究进展:实现从 Transformer 架构到 Mamba 状态空间模型(SSM)的跨架构知识蒸
📅 2026-04-20 07:23 (04-20 07:23) Berryxia.AI 人工智能 1 分鐘 ★ 79
Mamba Transformer 知识蒸馏 状态空间模型
LWiAI 播客 #238 - GPT-5.4 mini、OpenAI 战略转型、Mamba 3、注意力残差
📌 一句话摘要 一份全面的 AI 每周发展综述,涵盖 OpenAI 的 GPT-5.4 mini 发布、Mistral 的 Small 4 模型、日益激烈的 AI 智能体“操作系统”竞争,以及 Mamba-3 等重大研究进展。 📝 详细摘要 本期 Last Week in AI 播客总结了 AI
📅 2026-04-01 16:07 (04-01 16:07) Last Week in AI 人工智能 2 分鐘 ★ 86
GPT-5.4 Mistral Small 4 AI 智能体 Nvidia GTC
[AI 新闻] MiniMax 2.7:以 1/3 的成本实现 GLM-5 级别的 SOTA 开源模型
📌 一句话摘要 MiniMax 2.7 作为一款具备“自我进化”能力的高效 SOTA 开源模型发布,同时在智能体(Agent)架构工程、混合 SSM 架构以及多模态文档 AI 领域带来了重大更新。 📝 详细摘要 本期 AI 新闻重点介绍了 MiniMax 2.7 的发布,该模型以 1/3 的成本
📅 2026-03-19 14:47 (03-19 14:47) Latent.Space 人工智能 2 分鐘 ★ 82
MiniMax 2.7 LLM 效率 AI 智能体 Mamba-3
Mamba-3 发布,有望推动混合 AI 架构发展
📌 一句话摘要 Sebastian Raschka 强调了 Mamba-3 的发布,指出它在 Transformer 注意力混合架构(如 Qwen3.5 和 Kimi Linear)中的增强潜力,尤其是在引入 RoPE 之后。 📝 详细摘要 Sebastian Raschka 的这条推文宣布了
📅 2026-03-18 10:05 (03-18 10:05) Sebastian Raschka 人工智能 3 分鐘 ★ 85
Mamba-3 SSM 混合架构 Transformer
[AINews] Claude Cowork 快讯:Anthropic 对 OpenClaw 的回应
📌 一句话摘要 本期 AINews 重点介绍了 Anthropic 的 Claude Cowork、OpenAI 发布的 GPT-5.4 mini/nano 模型,以及行业向安全智能体基础设施和推理优化架构的重大转变。 📝 详细摘要 本文全面概述了 2026 年 3 月中旬以来的主要 AI 发展
📅 2026-03-18 12:59 (03-18 12:59) Latent.Space 人工智能 32 分鐘 ★ 75
AI 智能体 LLM OpenAI Anthropic
开源 Mamba 3 问世,语言建模能力提升近 4%,延迟降低,超越 Transformer 架构
📌 一句话摘要 Mamba 3 是一种新发布的开源状态空间模型(SSM)架构,通过“推理优先”设计,在语言建模方面比 Transformer 提升 4%,并显著降低了推理延迟。 📝 详细摘要 本文介绍了 Mamba 3,这是由研究人员 Albert Gu 和 Tri Dao 开发的状态空间模型(
📅 2026-03-18 07:06 (03-18 07:06) Carl Franzen 人工智能 10 分鐘 ★ 88
Mamba 3 状态空间模型 Transformer 架构 推理优化
Nemotron 3 Nano 4B:用于高效本地 AI 的紧凑型混合模型
📌 一句话摘要 英伟达推出 Nemotron 3 Nano 4B,这是一款混合 Mamba-Transformer 模型,通过新颖的弹性剪枝和蒸馏框架针对边缘设备进行了优化。 📝 详细摘要 文章详细介绍了 Nemotron 3 Nano 4B 的发布,这是一款紧凑型语言模型,专为在英伟达 RTX
📅 2026-03-18 07:17 (03-18 07:17) Vinay Raman, Ameya Sunil Mahabaleshwarkar, Hayley Ross, Bilal Kartal, Aditya Malte, Zijia Chen, Ali Taghibakhshi, Sharath Turuvekere Sreenivas, Saurav Muralidharan, Khalil Ben Khaled, Nima Tajbakhsh, Pavlo Molchanov, Oluwatobi Olabiyi, Yoshi Suhara 人工智能 10 分鐘 ★ 85
英伟达 SLM Mamba-Transformer 边缘 AI
老黄入局吃龙虾!英伟达发布最强开源 Agent 推理模型
📌 一句话摘要 英伟达发布 120B 参数开源 MoE 模型 Nemotron 3 Super,凭借 Mamba-Transformer 混合架构与 Blackwell 深度优化,在智能体推理与长文本任务中表现卓越。 📝 详细摘要 文章详细报道了英伟达最新发布的开源大模型 Nemotron 3
📅 2026-03-12 12:58 (03-12 12:58) 克雷西 人工智能 2 分鐘 ★ 89
英伟达 Nemotron 3 Super 开源模型 MoE
NVIDIA Nemotron 3 Super 120B MoE 模型在 Fireworks AI 首发上线
📌 一句话摘要 Fireworks AI 实现了对 NVIDIA Nemotron 3 Super 的首日(Day-0)支持,这是一款具有 100 万 Token 上下文长度的 120B 混合 MoE 模型。 📝 详细摘要 Fireworks AI 已启动对 NVIDIA Nemotron 3
📅 2026-03-12 03:09 (03-12 03:09) Fireworks AI 人工智能 1 分鐘 ★ 87
NVIDIA Nemotron 3 Super MoE Mamba 架构
NVIDIA Nemotron 3 Super 正式上线 OpenRouter
📌 一句话摘要 NVIDIA 的 Nemotron 3 Super 模型现已登陆 OpenRouter,该模型拥有 120B 参数、1M 上下文,并采用混合 Mamba-Transformer MoE 架构。 📝 详细摘要 OpenRouter 宣布支持 NVIDIA 的 Nemotron 3
📅 2026-03-12 00:16 (03-12 00:16) OpenRouter 人工智能 1 分鐘 ★ 88
NVIDIA Nemotron 3 Super MoE Mamba-Transformer