全部 未讀 (38309) ★ 收藏 (0) 🤖 人工智能 (14392) 📊 商业科技 (6719) 📁 媒体资讯 (5394) 📁 投资财经 (3318) 📁 生活文化 (2858) 💻 软件编程 (2059) 📁 个人成长 (1970) 📁 体育运动 (1009) 🎨 产品设计 (538) 📁 AI 产品 (39)
篩選中: 🏷️ 视频理解 共 19 篇 ✕ 清除篩選
38311
全部文章
38309
未讀
297
今日新增
0
收藏
📡 Poller 最後抓取: 27 分鐘前 (08-08 22:00)
BestBlogs 精選 (38238)

🏷️ 熱門標籤

AI Agent 3192 政策解读 1652 投资与市场 1430 AI 编程 1338 宏观经济 1304 产业动态 1280 国际新闻 1176 LLM 1160 Anthropic 1088 Claude Code 1040 社会议题 1026 国内新闻 993 地缘政治 944 OpenAI 894 科技新闻 893 AI 智能体 788 生活方式 712 开源 684 足球 681 个人成长 678
今日开源(2026-7-23):小红书开源 BigMac,多模态 LLM 流水并行训练新范式,嵌套编码器与生成器至 LLM 流水线,训练提速 1.08-1.9 倍
📌 一句话摘要 机器之心 SOTA 模型栏目汇总了 6 个近期开源项目,涵盖视频多模态模型 VideoChat3、金融 K 线模型 Kronos、训练工具 BigMac、航空 3D 视觉数据集 AirZoo、架构建模语言 LikeC4 与 WiFi 传感平台 RuView。 📝 详细摘要 本文是
📅 2026-07-23 15:10 (16 天前) 机器之心SOTA模型 人工智能 4 分鐘 ★ 80
开源项目 多模态模型 视频理解 金融科技
打通感知-理解-交互链路,全栈视频理解大模型 VideoChat3 开源了
📌 一句话摘要 南京大学等团队开源 VideoChat3,一个 4B 参数的全栈视频理解模型,通过 I3D-ViT 和自适应分辨率机制兼顾短视频、长视频和在线流式理解,并全面开源数据和代码。 📝 详细摘要 VideoChat3 由南京大学、上海人工智能实验室、南洋理工大学和北京大学联合发布,是一
📅 2026-07-22 12:00 (17 天前) 机器之心 人工智能 2 分鐘 ★ 85
视频理解 多模态大模型 视觉语言模型 时序建模
claude-real-video:用场景切换检测让 LLM 真正“看懂”视频
📌 一句话摘要 开源项目 claude-real-video 通过场景切换检测和滑动窗口去重,智能抽取视频关键帧,大幅节省 Token 并提升多模态模型理解准确度。 📝 详细摘要 本文深度解析了开源项目 claude-real-video 的核心技术原理。它不同于 Gemini 等固定帧率采样,
📅 2026-07-20 08:41 (19 天前) AIGCLINK 人工智能 1 分鐘 ★ 84
视频理解 多模态 开源 Claude
刚刚,一个开源项目火了:Claude、ChatGPT 终于能真正“看视频”了?
📌 一句话摘要 本文介绍开源项目 claude-real-video,通过场景检测、关键帧提取、去重和字幕对齐等技术,让大语言模型无需原生视频理解能力就能分析视频内容。 📝 详细摘要 文章详细介绍了 claude-real-video 开源项目的技术原理与五大亮点。该项目不依赖模型原生视频能力,
📅 2026-07-06 16:36 (07-06 16:36) 51CTO技术栈 人工智能 5 分鐘 ★ 80
开源项目 AI工具 视频理解 场景检测
全球首个!京东全栈开源 JoyAI-VL-Interaction,让大模型从“一问一答”走向“边看边说”
📌 一句话摘要 京东开源全球首个全栈实时视频视觉语言交互模型 JoyAI-VL-Interaction,支持持续观察视频流、自主判断与主动响应,并获得 vLLM-Omni 原生支持。 📝 详细摘要 文章宣布京东开源实时视频视觉语言交互模型 JoyAI-VL-Interaction,这是全球首个全
📅 2026-06-22 17:36 (06-22 17:36) 京东技术 人工智能 4 分鐘 ★ 80
多模态 AI 开源模型 视频理解 AI Agent
入选 ECCV 2026!清华开源空间模型打败 Gemini:真正的空间智能是在世界变化中持续学习
📌 一句话摘要 清华提出 Spatial-TTT 模型,采用测试时训练(TTT)机制在长视频流中持续更新空间记忆,以 2B 参数量在多项空间智能基准上超越 GPT-5、Gemini-3-pro 等闭源模型,被 ECCV 2026 接收。 📝 详细摘要 文章介绍清华大学等机构入选 ECCV 202
📅 2026-06-22 11:48 (06-22 11:48) 思邈 人工智能 2 分鐘 ★ 84
空间智能 多模态大模型 测试时训练 长视频理解
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
📌 一句话摘要 格灵深瞳灵感实验室分享了其在低成本全帧率视频理解上的技术突破,以及从 CV 到多模态时代,如何通过分层部署策略解决真实业务落地的工程化思考。 📝 详细摘要 本文是 InfoQ 对格灵深瞳灵感实验室的深度访谈。文章核心围绕两个层面展开:技术层面,灵感实验室介绍了其最新成果 LLaV
📅 2026-05-20 16:39 (05-20 16:39) InfoQ 中文 人工智能 2 分鐘 ★ 88
全帧率视频理解 LLaVA-OneVision-2.0 视觉编码器 VLM
美团 CVPR 2026 中稿精选:视觉生成遇上慢思考,解码多模态推理新范式
📌 一句话摘要 本文精选了美团技术团队被 CVPR 2026 收录的 10 篇论文,涵盖多模态交互、数字人、图像定制、海报生成、视频压缩与视觉推理等前沿方向。 📝 详细摘要 文章是美团技术团队在 CVPR 2026 上的中稿论文精选集,共介绍了 10 篇被 Main Conference 收录的
📅 2026-05-19 15:10 (05-19 15:10) PaperWeekly 人工智能 2 分鐘 ★ 85
CVPR 2026 美团 多模态 视觉生成
让大模型理解真实医疗视频,全球首个开源技术方案来了!
📌 一句话摘要 联影智能发布全球首个开源医疗视频理解大模型 uAI-NEXUS-MedVLM,配套 MedVidBench 基准数据集和 MedGRPO 训练方法,解决医疗视频理解的空间-时间-语义三重复杂性难题。 📝 详细摘要 本文报道了联影智能(联影集团旗下 AI 子公司)发布的全球首个开源
📅 2026-04-28 15:41 (04-28 15:41) 机器之心 人工智能 1 分鐘 ★ 88
医疗视频理解 多模态大模型 强化学习 MedGRPO
今日开源(2026-4-27):谷歌开源 TIPSv2 模型,对比学习框架驱动图像文本特征对齐,覆盖零样本分类应用场景
📌 一句话摘要 本文汇总了 2026 年 4 月 27 日的 6 个开源项目,涵盖视觉语言模型、智能体诊断系统、技能编译框架、医学视频理解、多语言扩展和推理优化等方向。 📝 详细摘要 文章以信息简报形式介绍了 6 个最新开源项目。TIPSv2 是谷歌开源的对比式视觉语言模型,支持零样本分类和空间
📅 2026-04-27 18:30 (04-27 18:30) 机器之心SOTA模型 人工智能 2 分鐘 ★ 82
开源项目 视觉语言模型 智能体诊断 技能编译
记得住、答得快、用得省:HERMES 让流式视频理解实时响应提速 10 倍
📌 一句话摘要 复旦大学等机构提出 HERMES 框架,通过将 KV Cache 建模为层次化记忆系统,实现流式视频理解中无需额外检索的实时响应,首 token 生成时间加速最高 10 倍。 📝 详细摘要 本文介绍了由复旦大学、上海创智学院与新加坡国立大学联合提出的 HERMES 框架,旨在解决
📅 2026-04-24 17:06 (04-24 17:06) 机器之心 人工智能 2 分鐘 ★ 88
流式视频理解 KV Cache 层次化记忆 HERMES
Gemma 4 的 10 个令人印象深刻的创意应用案例
📌 一句话摘要 Gemma 4 模型正催生出全新的创意应用,推文开始列举包括本地视频理解在内的 10 个精彩案例。 📝 详细摘要 这条推文独立于前面的 Thread,分享了关于 Google Gemma 4 模型的应用案例。发布者称赞 Gemma 4“令人印象深刻得出奇”,并指出人们正在解锁全新
📅 2026-04-16 16:40 (04-16 16:40) AI Will 人工智能 1 分鐘 ★ 83
Gemma 4 Google 视频理解 本地 AI
CVPR 2026 | 火山引擎多媒体实验室提出 TempR1,显著增强多模态大模型视频时序理解能力
📌 一句话摘要 本文介绍了火山引擎多媒体实验室与南京大学联合提出的 TempR1 方法,该方法通过多任务强化学习框架和定制化时序奖励设计,系统性提升了多模态大模型在五大视频时序理解任务上的性能与泛化能力。 📝 详细摘要 文章详细阐述了针对多模态大模型视频时序理解能力不足的解决方案 TempR1。
📅 2026-04-13 18:05 (04-13 18:05) 字节跳动技术团队 人工智能 2 分鐘 ★ 89
多模态大模型 视频理解 时序推理 强化学习
南大团队直击大模型高分神话:人类 90 分,最强模型仅 49 分
📌 一句话摘要 南京大学傅朝友团队发布视频理解新基准 Video-MME-v2,通过创新的三层能力体系与组级非线性评分,揭示了当前最强视频模型与人类专家在严格评测下存在巨大差距,并发现「思维链」增益高度依赖文本线索。 📝 详细摘要 文章报道了南京大学傅朝友团队在 Google Gemini 评测
📅 2026-04-13 12:04 (04-13 12:04) 新智元 人工智能 2 分鐘 ★ 91
多模态大模型 视频理解 评测基准 南京大学
流媒体视频理解的简单基准方法
📌 一句话摘要 一篇提出流媒体视频理解简单基准方法的新研究论文。 📝 详细摘要 该推文介绍了一篇针对流媒体视频理解提出简化基准方法的研究论文,这对于计算机视觉和视频分析任务具有参考价值。 📊 文章信息 AI 评分:78 来源:AK(@_akhaliq) 作者:AK 分类:人工智能 语言:英文
📅 2026-04-06 23:50 (04-06 23:50) AK 人工智能 1 分鐘 ★ 78
视频理解 计算机视觉 AI 研究 机器学习
阿里发布 Qwen3.5-Omni,多模态能力超越 Gemini-3.1 Pro
📌 一句话摘要 阿里发布全模态大模型 Qwen3.5-Omni,在音视频理解与交互等 215 项任务中取得 SOTA,性能超越 Gemini-3.1 Pro 且价格极具竞争力。 📝 详细摘要 阿里正式发布新一代全模态大模型 Qwen3.5-Omni。该模型在音视频理解、识别及实时交互等 215
📅 2026-03-30 22:21 (03-30 22:21) 量子位的朋友们 人工智能 1 分鐘 ★ 88
Qwen3.5-Omni 全模态大模型 阿里云 音视频理解
Meta AI 发布 V-JEPA 2.1,解锁视频自监督学习新能力
📌 一句话摘要 V-JEPA 2.1 正式发布,在视频自监督学习领域引入了解锁稠密特征的重大进展。 📝 详细摘要 本条推文宣布了 V-JEPA 2.1 的发布,这是 Meta 联合嵌入预测架构(Joint-Embedding Predictive Architecture)的一次更新。该论文重点
📅 2026-03-20 05:31 (03-20 05:31) AK 人工智能 1 分鐘 ★ 78
V-JEPA Meta AI 计算机视觉 自监督学习
Video-CoE:通过事件链增强视频事件预测
📌 一句话摘要 一篇新的研究论文介绍了 Video-CoE,这是一种利用“事件链”(Chain of Events)方法来改进视频事件预测的技术。 📝 详细摘要 这条推文介绍了一篇关于“Video-CoE”的研究论文,这是一种旨在通过利用事件链框架来增强视频事件预测的技术。它提供了 Huggin
📅 2026-03-19 23:43 (03-19 23:43) AK 人工智能 3 分鐘 ★ 75
Video-CoE 视频理解 事件预测 机器学习
腾讯联合清华推出 Spatial-TTT:赋能流式视觉空间智能
📌 一句话摘要 Spatial-TTT 是一款全新的框架,利用测试时训练(TTT)技术,在视频流中实现高效的长时程 3D 空间记忆与理解。 📝 详细摘要 腾讯混元与清华大学合作发布了“Spatial-TTT”,这是一个专为流式视觉空间智能设计的框架。通过利用测试时训练(TTT)技术,该模型能够更
📅 2026-03-16 18:07 (03-16 18:07) Tencent HY 人工智能 1 分鐘 ★ 88
Spatial-TTT 测试时训练 计算机视觉 3D 空间记忆