全部 未讀 (37688) ★ 收藏 (0) 🤖 人工智能 (14292) 📊 商业科技 (6631) 📁 媒体资讯 (5216) 📁 投资财经 (3200) 📁 生活文化 (2769) 💻 软件编程 (2049) 📁 个人成长 (1953) 📁 体育运动 (995) 🎨 产品设计 (531) 📁 AI 产品 (39)
篩選中: 🏷️ 模型架构 共 46 篇 ✕ 清除篩選
37690
全部文章
37688
未讀
198
今日新增
0
收藏
📡 Poller 最後抓取: 1 小時前 (08-06 18:00)
BestBlogs 精選 (37617)

🏷️ 熱門標籤

AI Agent 3156 政策解读 1593 投资与市场 1382 AI 编程 1325 宏观经济 1264 产业动态 1248 国际新闻 1150 LLM 1147 Anthropic 1087 Claude Code 1038 社会议题 983 国内新闻 958 地缘政治 924 OpenAI 891 科技新闻 879 AI 智能体 788 生活方式 688 开源 683 足球 671 个人成长 661
详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
📌 一句话摘要 从工程与算法双视角,深度拆解 K3 作为首个 3T 级开源模型的架构创新、训练工程与开源生态影响。 📝 详细摘要 本期节目从架构与工程双重视角,深度解读了 Kimi 最新发布的 K3 模型。嘉宾赵晨阳和曾致远详细拆解了 K3 的技术报告,指出其核心创新在于采用了一种名为 KDA
📅 2026-08-04 06:45 (2 天前) 晚点聊 LateTalk 人工智能 48 分鐘 ★ 88
Kimi K3 开源模型 混合注意力机制 模型架构
大模型重回参数竞赛:2 万亿成标配,3 万亿是下一站? - 经济观察网 - 专业财经新闻网站
📌 一句话摘要 本文分析中国大模型厂商正重启参数竞赛,月之暗面发布的 2.78 万亿参数模型 Kimi K3 引领潮流,探讨技术演进、产业链传导及商业化路径。 📝 详细摘要 文章深度解析中国大模型行业从 2025 年深度优化转向 2026 年参数规模竞赛的转变。月之暗面 Kimi K3(2.78
📅 2026-08-02 18:27 (4 天前) 经济观察网 人工智能 2 分鐘 ★ 89
大模型 参数竞赛 AI 技术 模型架构
谁在训练 Kimi K3 ? 深挖贡献者名单,这有一份最全档案
📌 一句话摘要 文章梳理了月之暗面 Kimi K3 模型背后 400 余名核心贡献者的背景与贡献,展示其年轻团队、技术创新与独特企业文化。 📝 详细摘要 文章通过详细列出月之暗面(Moonshot AI)在 Kimi K3 模型中的 400 余人贡献者名单,展示了该团队的年轻化特征(平均年龄不到
📅 2026-07-30 18:25 (7 天前) AI科技评论 人工智能 2 分鐘 ★ 76
人工智能 大语言模型 模型架构 开源贡献
黄仁勋为何力挺梁文锋、杨植麟?
📌 一句话摘要 文章剖析中国大模型公司通过重塑 Transformer 关键部件、混合专家模型和长上下文技术,突破算力与数据壁垒,并解释黄仁勋为何公开支持梁文锋、杨植麟的背后动机。 📝 详细摘要 本文聚焦中国大模型在算力围墙与数据墙双重约束下的技术突围。作者详细阐述了 Kimi 系列模型(K2.
📅 2026-07-28 18:35 (9 天前) 腾讯科技 人工智能 2 分鐘 ★ 88
大模型 模型架构 算力围墙 混合专家模型
把思考折叠进序列:WeLM 617B MoE 的隐式 Scaling 路径
📌 一句话摘要 微信 WeLM 团队提出 Hidden Decoding 方法,将额外算力折叠进序列内部实现隐式推理,并在 617B MoE 模型上验证了全面超越自回归基线的效果。 📝 详细摘要 文章详细介绍了微信 WeLM 团队最新发布的 Hidden Decoding 技术及其在 617B
📅 2026-07-24 12:33 (13 天前) 新智元 人工智能 7 分鐘 ★ 84
大语言模型 模型架构 Scaling Law MoE
探讨大模型参数规模增长与 Gated Delta Networks 架构
📌 一句话摘要 作者分析近期大模型参数量突破 T 级且质量提升的原因,重点关注 Gated Delta Networks 及 Mamba 相关的混合架构。 📝 详细摘要 作者通过阅读论文发现 Gated Delta Networks(基于 Mamba 思想)可能是近期大模型(如英伟达 Nemot
📅 2026-07-21 12:19 (16 天前) 向阳乔木 人工智能 1 分鐘 ★ 76
模型架构 Gated Delta Networks Mamba LLM
通识为体、专业为用:Intern-S2-Preview-397B 开启科学智能体基座时代 | WAIC 2026
📌 一句话摘要 上海 AI 实验室发布 Intern-S2-Preview-397B 科学基座模型,通过 Memory Decoder 与 Mobius 架构解耦知识存储与逻辑推理,在分子设计、材料生成等任务上追平万亿参数模型,并推出「书生·端砚」科学发现平台。 📝 详细摘要 2026 WAIC
📅 2026-07-20 16:30 (17 天前) 魔搭ModelScope社区 人工智能 5 分鐘 ★ 82
AI模型发布 AI4S 科学智能 大模型架构
397B 参数追平万亿模型,上海 AI Lab 发布科学智能体新基座 | WAIC 2026
📌 一句话摘要 上海 AI Lab 发布 Intern-S2-Preview-397B 模型,以 397B 参数通过架构革新追平万亿模型,实现知识与推理分离,并在科学任务上显著提升效率。 📝 详细摘要 文章报道了上海人工智能实验室在 WAIC 2026 发布的 Intern-S2-Preview
📅 2026-07-17 17:20 (20 天前) 量子位的朋友们 人工智能 2 分鐘 ★ 84
大模型 科学智能 AI4S 模型架构
[随笔]什么是 AI Native
📌 一句话摘要 本文是作者关于 AI Native 的深度随笔,提出核心观点:AI Native 的本质应是「Human as a Copilot for AI Model」,即人做模型的副驾驶,而非模型做人的副驾驶。 📝 详细摘要 这是一篇以随笔形式展开的技术思考文章。作者首先分享了自己回避复
📅 2026-07-11 17:12 (26 天前) zartbot 人工智能 4 分鐘 ★ 86
AI Native 模型架构 访存瓶颈 思维模型
Z Tech|专访 FaceMind 创始人 Adam Lu:循环世界模型(LoopWM)极有可能是下一代通用世界模型架构
📌 一句话摘要 本文专访 FaceMind 创始人 Adam Lu,深度解析循环世界模型 LoopWM 的架构设计、训练策略及其对世界模型未来发展的关键判断。 📝 详细摘要 本文是一篇对 FaceMind 创始人 Adam Lu 的独家专访,围绕其团队提出的循环世界模型 LoopWM 展开。文章
📅 2026-07-01 12:20 (07-01 12:20) Z Potentials 人工智能 2 分鐘 ★ 89
世界模型 模型架构 具身智能 机器人技术
Loop 世界模型论文登顶 Hugging Face,来自中国一家初创,周鸿祎陆奇都投了
📌 一句话摘要 本文报道中国初创公司 FaceMind Research Asia 的 Looped World Models(LoopWM)论文登顶 Hugging Face Papers,介绍其通过共享参数循环迭代实现世界模型参数效率 100 倍提升,并披露公司背景与投资方。 📝 详细摘要
📅 2026-07-01 15:24 (07-01 15:24) 思邈 人工智能 2 分鐘 ★ 86
世界模型 AI Agent 循环架构 模型架构
Jumper 跳槽 Anthropic 后复盘 AlphaFold 的苦涩教训:成功源于定制化架构,根本不靠堆算力
📌 一句话摘要 AlphaFold 核心开发者 John Jumper 在访谈中详细复盘了 AlphaFold 的成功原因,强调其成功依赖针对蛋白质折叠任务的定制化架构设计,而非盲目堆算力,并有力反驳了「苦涩的教训」这一 AI 领域流行观点。 📝 详细摘要 文章是对 John Jumper(前
📅 2026-06-27 11:50 (06-27 11:50) DeepTech深科技 人工智能 6 分鐘 ★ 86
AlphaFold 蛋白质结构预测 深度学习 科学AI
Gemma 4 12B 通过无编码器架构实现设备端多模态主动工作流
📌 一句话摘要 本文介绍谷歌 Gemma 4 12B 模型,其采用无编码器多模态架构,可直接处理图像和音频,支持设备端本地部署与自主工作流。 📝 详细摘要 文章详细报道了谷歌发布的 Gemma 4 12B 模型,核心创新是统一式无编码器多模态架构,省去独立的视觉与音频编码器,降低延迟与内存碎片。
📅 2026-06-22 12:55 (06-22 12:55) InfoQ 中文 人工智能 2 分鐘 ★ 82
多模态 AI AI Agent 模型架构 设备端推理
Transformer 之父离开谷歌,奥特曼等了他十年
📌 一句话摘要 Transformer 核心作者 Noam Shazeer 离开 Google 加入 OpenAI,担任架构研究负责人,标志着 AI 行业开始寻找 Transformer 之后的下一代模型架构。 📝 详细摘要 本文报道了 AI 领域一则重磅人事变动:Transformer 核心作
📅 2026-06-19 11:08 (06-19 11:08) 虎嗅APP 人工智能 8 分鐘 ★ 85
AI 人物 LLM Transformer AI Agent
HuggingFace CEO 力荐,Bengio 团队也押注:这个 1500 美元训出的 HRM 模型,凭什么火了?
📌 一句话摘要 本文深度解读 Sapient Intelligence 发布的 HRM-Text 模型,分析其 1500 美元训出 1B 参数模型背后的分层递归推理架构,并论证该路线正在成为下一代推理模型的重要方向。 📝 详细摘要 文章围绕 Sapient Intelligence 发布的 HR
📅 2026-06-13 20:40 (06-13 20:40) 鹭羽 人工智能 2 分鐘 ★ 86
AI 模型 LLM 推理模型 模型架构
新架构模型 HRM-Text 创新纪录!1B 参数、1000 美元,图灵奖得主都亲自下场了
📌 一句话摘要 本文深度解读 Sapient Intelligence 发布的 HRM-Text 模型,该模型以 1B 参数和极低训练成本,通过分层递归架构与针对性训练目标,在推理基准上挑战了传统 Scaling Law,并获得了图灵奖得主 Yoshua Bengio 的跟进研究。 📝 详细摘要
📅 2026-06-09 12:07 (06-09 12:07) 机器之心 人工智能 2 分鐘 ★ 88
LLM 模型架构 AI Agent 模型训练与推理
有关第三代模型,苹果管理层回应一切
📌 一句话摘要 苹果在 WWDC 2026 上发布第三代基础模型 AFM 3,包含 5 款模型,通过指令跟随剪枝、MoE 架构和与谷歌 Gemini 的蒸馏合作,在端侧和云端实现了 AI 能力的全面升级,并明确了隐私边界与合作细节。 📝 详细摘要 本文是腾讯科技对苹果 WWDC 2026 上发布
📅 2026-06-09 16:06 (06-09 16:06) 腾讯科技 人工智能 2 分鐘 ★ 88
LLM Apple 端侧模型 模型架构
jina-embeddings-v5-omni 发布!全模态向量小模型
📌 一句话摘要 Jina AI 发布 jina-embeddings-v5-omni 全模态向量模型,通过冻结文本底座并仅训练 0.35% 的投影层参数,以极低成本实现了文本、图像、音频、视频四模态支持,且文本向量与 v5-text 逐字节一致,无需重建索引。 📝 详细摘要 Jina AI 正式
📅 2026-05-14 17:37 (05-14 17:37) 魔搭ModelScope社区 人工智能 2 分鐘 ★ 86
jina-embeddings-v5-omni 多模态向量模型 Jina AI 嵌入模型
开源神话:DeepSeek-V4 开源 SOTA!总参数 1.6T,最大开源模型;Flash 版输出仅 0.28 美元/百万 token;与 OpenClaw 等无缝集成;三项架构升级
📌 一句话摘要 DeepSeek 正式发布并开源 V4 系列模型,包含 1.6T 总参数的 Pro 版和 284B 总参数的 Flash 版,在多项基准测试中达到开源 SOTA,API 定价极低,并引入三项关键架构升级。 📝 详细摘要 本文报道了 DeepSeek-V4 系列模型的发布。该系列包
📅 2026-04-24 14:19 (04-24 14:19) 51CTO技术栈 人工智能 2 分鐘 ★ 86
DeepSeek-V4 开源模型 大语言模型 模型架构
DeepSeek-V4 全新注意力机制解析
📌 一句话摘要 DeepSeek-V4 结合 token 压缩与 DSA 稀疏注意力,实现低功耗长上下文能力。 📝 详细摘要 作为前条推文的补充,深入解释了 DeepSeek-V4 的技术特性。该模型开创了在 token 维度进行压缩的注意力机制,并结合 DSA(DeepSeek Sparse
📅 2026-04-24 12:02 (04-24 12:02) Berryxia.AI 人工智能 1 分鐘 ★ 83
DeepSeek-V4 注意力机制 DSA 长上下文