全部 未讀 (37993) ★ 收藏 (0) 🤖 人工智能 (14351) 📊 商业科技 (6670) 📁 媒体资讯 (5287) 📁 投资财经 (3259) 📁 生活文化 (2818) 💻 软件编程 (2056) 📁 个人成长 (1961) 📁 体育运动 (1005) 🎨 产品设计 (534) 📁 AI 产品 (39)
篩選中: 🏷️ 视觉模型 共 5 篇 ✕ 清除篩選
37995
全部文章
37993
未讀
263
今日新增
0
收藏
📡 Poller 最後抓取: 2 小時前 (08-07 20:00)
BestBlogs 精選 (37912)

🏷️ 熱門標籤

AI Agent 3177 政策解读 1616 投资与市场 1408 AI 编程 1331 宏观经济 1282 产业动态 1265 国际新闻 1159 LLM 1152 Anthropic 1087 Claude Code 1038 社会议题 1002 国内新闻 970 地缘政治 931 OpenAI 892 科技新闻 884 AI 智能体 788 生活方式 701 开源 684 足球 678 个人成长 671
用 OpenAI 视觉模型实现衣物识别与虚拟试穿
📌 一句话摘要 介绍一个利用 OpenAI 视觉模型自动识别衣物、抠图并生成模特上身预览的工具,配套 Codex 技能。 📝 详细摘要 该推文分享了一个开源项目 Wardrobe,它通过 OpenAI 视觉模型识别照片中的衣物、自动抠图,并生成模特上身预览效果。此外,配套的 Codex 技能可以
📅 2026-07-18 11:10 (20 天前) Geek 人工智能 2 分鐘 ★ 82
OpenAI 视觉模型 衣物识别 自动抠图 虚拟试穿
DeepSeek 识图模式是个新模型?!一手实测在此(没错我被灰度到了)
📌 一句话摘要 本文实测了 DeepSeek 灰度测试中的识图模式,发现其背后可能是一个独立于 V4 的新视觉模型,在 OCR 和 HTML 复原等任务上表现出色,但空间推理和找不同等任务仍存在幻觉和思考过长的问题。 📝 详细摘要 文章作者在获得 DeepSeek 识图模式灰度测试资格后,对该功
📅 2026-04-30 14:52 (04-30 14:52) 鱼羊 人工智能 2 分鐘 ★ 86
DeepSeek 识图模式 多模态 视觉模型
LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征
📌 一句话摘要 美团技术团队提出 LARYBench,首个系统化评估隐式动作表征质量的基准,实验发现通用视觉模型在动作泛化上显著优于具身专项模型。 📝 详细摘要 本文由美团技术团队发布,介绍了他们提出的 LARYBench(Latent Action Representation Yieldin
📅 2026-04-27 08:00 (04-27 08:00) 作者: 美团LongCat 人工智能 2 分鐘 ★ 88
具身智能 隐式动作表征 LARYBench 通用视觉模型
Mano-P 1.0:纯视觉 GUI 操作模型,让 AI 拥有真正的“眼睛和手”
📌 一句话摘要 Mano-P 1.0 是一个纯视觉 GUI 操作模型,通过识别屏幕截图来操作任意界面,无需依赖 DOM 或 API,可接入 Agent 工具实现复杂的本地自动化任务。 📝 详细摘要 这条推文介绍了一个名为 Mano-P 1.0 的创新开源项目。它旨在解决现有 AI 界面自动化方案
📅 2026-04-15 18:00 (04-15 18:00) GitHubDaily 人工智能 1 分鐘 ★ 86
Mano-P GUI 自动化 视觉模型 AI Agent
LlamaParse:智能体驱动型 OCR 革新文档解析
📌 一句话摘要 LlamaIndex 首席执行官 Jerry Liu 介绍了 LlamaParse 的“智能体驱动型 OCR”基础,该技术利用专用智能体网络和视觉模型,实现了语义化、无需模板的文档解析。 📝 详细摘要 LlamaIndex 首席执行官 Jerry Liu 探讨了 OCR 技术的发
📅 2026-03-13 08:16 (03-13 08:16) Jerry Liu 人工智能 4 分鐘 ★ 86
智能体驱动型 OCR LlamaParse 文档解析 多模态 AI