全部 未讀 (37907) ★ 收藏 (0) 🤖 人工智能 (14333) 📊 商业科技 (6662) 📁 媒体资讯 (5264) 📁 投资财经 (3250) 📁 生活文化 (2798) 💻 软件编程 (2056) 📁 个人成长 (1960) 📁 体育运动 (999) 🎨 产品设计 (533) 📁 AI 产品 (39)
篩選中: 🏷️ 数据集 共 33 篇 ✕ 清除篩選
37909
全部文章
37907
未讀
177
今日新增
0
收藏
📡 Poller 最後抓取: 34 分鐘前 (08-07 14:00)
BestBlogs 精選 (37836)

🏷️ 熱門標籤

AI Agent 3170 政策解读 1610 投资与市场 1405 AI 编程 1330 宏观经济 1278 产业动态 1261 国际新闻 1156 LLM 1150 Anthropic 1087 Claude Code 1038 社会议题 994 国内新闻 968 地缘政治 929 OpenAI 892 科技新闻 884 AI 智能体 788 生活方式 696 开源 684 足球 673 个人成长 668
国内 8 大 AI 平台搜索引用数据集开源,GEO 研究有了真实数据基础
📌 一句话摘要 姚金刚老师开源了覆盖 620 个问题、近 19 万条 AI 引用记录的数据集,首次公开了各大平台的信源分布和规律。 📝 详细摘要 作者转述并解读了姚金刚开源的数据集,该数据集包含豆包、DeepSeek、Kimi 等 8 个平台的搜索引用数据,共 620 个标准问题、189845
📅 2026-07-22 07:58 (16 天前) Berryxia.AI 人工智能 4 分鐘 ★ 85
GEO AI 搜索 数据集开源 中文 AI 平台
国内各大 AI 平台 GEO 原始数据集开源
📌 一句话摘要 分享由 yaojingang 开源的涵盖 8 个国内主流 AI 平台的 GEO 搜索结果与信源特征数据集。 📝 详细摘要 该推文转发了关于国内 AI 平台(包括豆包、DeepSeek、Kimi、千问等)GEO 数据集开源的消息。数据集包含 620 个标准问题、近 19 万条引用观
📅 2026-07-21 16:13 (16 天前) 向阳乔木 人工智能 1 分鐘 ★ 75
开源数据集 GEO AI搜索 数据分析
国内各大 AI 平台 GEO 原始数据集开源及分析报告
📌 一句话摘要 姚金刚开源了涵盖 8 个国内主流 AI 平台的 GEO 原始数据集,并分享了关于信源分布和共识度的深度洞察。 📝 详细摘要 该推文宣布开源一份针对国内 AI 搜索(如 DeepSeek, Kimi, 豆包, 元宝等)的 GEO(生成式引擎优化)数据集,包含 620 个标准问题和近
📅 2026-07-21 09:20 (17 天前) 姚金刚 人工智能 1 分鐘 ★ 87
GEO AI Search 数据集开源 信源分析
端到端 vs 上下分层:机器人路径之争,正在转向?
📌 一句话摘要 苏度科技 CEO 韩铮深度解析机器人操作的「圣杯」难题,详述其为何押注上下分层架构与 Sim-to-Real 技术路径,并预言该路线将重回主流。 📝 详细摘要 本期节目深度访谈机器人初创公司苏度科技 CEO 韩铮,聚焦于实现通用机器人「动手」能力的技术路径之争。韩铮详细阐述了苏度
📅 2026-07-16 08:00 (22 天前) 硅谷101 商业科技 30 分鐘 ★ 87
机器人 Sim-to-Real 3D 数据集 上下分层
论文秀 Live#42 | ICML 2026 论文解读
📌 一句话摘要 本期论文秀深度解读 ICML 2026 的三篇前沿论文,分别聚焦移动 GUI 智能体用户中心化评测、扩散语言模型推理优化与数据集剪枝框架,展示大模型高效落地的最新突破。 📝 详细摘要 本期「论文秀」精选 ICML 2026 三篇前沿研究,针对大模型落地的三大核心挑战——移动智能体
📅 2026-07-14 17:33 (23 天前) 蚂蚁技术AntTech 人工智能 2 分鐘 ★ 92
ICML AI Agent 移动GUI 扩散模型
终于有个非 AI 相关的项目登上 GitHub 热榜,高低得推荐一下。
📌 一句话摘要 本文推荐并介绍了一个名为 exercises-dataset 的健身动作开源数据集,包含 1324 个动作、多语言说明及开发者工具,可快速构建健身应用。 📝 详细摘要 文章以一个非 AI 开源项目登上 GitHub 热榜为由,详细介绍 exercises-dataset 项目。该
📅 2026-07-07 13:15 (07-07 13:15) 逛逛GitHub 软件编程 1 分鐘 ★ 78
开源项目 数据集 健身 开发者工具
看专利数据里的高质量数据集建设密码
📌 一句话摘要 本文通过政策解读与企业案例,分析专利数据作为高质量数据集在 AI 赋能产业中的关键价值,指出数据供给不足是制约产业落地的瓶颈。 📝 详细摘要 文章从国家数据局和国务院关于高质量数据集建设的政策文件切入,指出行业高质量数据供给不足制约 AI 产业落地,而专利数据作为兼具技术公开性与
📅 2026-07-06 12:51 (07-06 12:51) 新华社 人工智能 6 分鐘 ★ 84
高质量数据集 专利数据 AI训练数据 人工智能
最大开源第一视角数据集 EgoLive 来了,名校站台、近百家机构争相申请
📌 一句话摘要 文章介绍京东开源的最大第一视角数据集 EgoLive,涵盖 2000 小时真实场景操作视频,并阐述其在具身智能训练中的价值及京东的物理世界运营中心布局。 📝 详细摘要 本文详细报道了京东开源的第一视角数据集 EgoLive。作为当前业界最大规模的人类第一视角数据集,EgoLive
📅 2026-06-25 16:38 (06-25 16:38) InfoQ 中文 人工智能 6 分鐘 ★ 83
具身智能 第一视角数据 数据集 机器人
全球首个机器人训练楼盘开盘:30 万套中国住宅,机器人拎包入住
📌 一句话摘要 大晓机器人联合港中文 MMLab 发布 Kairos-Homeworld,将 30 万套中国真实住宅户型转化为具身智能训练仿真环境,并开源 4B 参数世界模型 Kairos 3.0-4B,为机器人提供数字训练场与物理理解大脑。 📝 详细摘要 文章报道了大晓机器人联合港中文 MML
📅 2026-06-05 14:33 (06-05 14:33) henry 人工智能 2 分鐘 ★ 87
具身智能 世界模型 仿真环境 机器人训练
最大开源中文预训练合成数据集来了!面壁清华端出 6000 亿 Token 大模型“精饲料”
📌 一句话摘要 面壁智能联合清华大学、OpenBMB 开源了最大中文预训练合成数据集 Ultra-FineWeb-L3(6000 亿 Token)和千万级 SFT 数据集 UltraData-SFT-2605,旨在缓解高质量训练数据短缺问题。 📝 详细摘要 本文报道了面壁智能、清华大学和 Ope
📅 2026-05-29 21:34 (05-29 21:34) 智东西 人工智能 2 分鐘 ★ 83
开源数据集 预训练 SFT 面壁智能
大模型竞争下半场:千万级 SFT + 全球最大中文合成数据,一起开源了!
📌 一句话摘要 面壁智能联合清华大学、OpenBMB 开源了 UltraData 系列两大 L3 层级数据集:全球最大中文预训练合成数据 Ultra-FineWeb-L3 和千万级 SFT 数据 UltraData-SFT-2605,并公开了 L0-L4 数据分级治理体系,旨在推动大模型竞争从参数
📅 2026-05-29 22:26 (05-29 22:26) Datawhale 人工智能 2 分鐘 ★ 88
数据治理 合成数据 SFT 开源数据集
OmniScience:大规模科学多模态数据集重磅上线
📌 一句话摘要 深势科技联合魔搭社区发布了基于 Uni-Parser 框架构建的大规模科学多模态数据集 OmniScience,包含 150 万组高质量「图-文-上下文」数据,旨在提升 AI 对复杂科学图像的理解能力,推动 AI for Science 发展。 📝 详细摘要 本文介绍了由深势科技
📅 2026-04-20 21:11 (04-20 21:11) 魔搭ModelScope社区 人工智能 2 分鐘 ★ 87
OmniScience 多模态数据集 AI for Science 科学图像理解
全球最大规模含触觉数据集,凭什么吸引谷歌和众多高校的加入?
📌 一句话摘要 戴盟机器人联合 Google DeepMind 等数十家顶尖机构,发布了全球最大规模含触觉的全模态物理世界数据集 Daimon Infinity,旨在通过开源高质量数据和构建生态,加速具身智能的落地。 📝 详细摘要 文章报道了由戴盟机器人主导,联合 Google DeepMind
📅 2026-04-20 15:55 (04-20 15:55) 量子位的朋友们 人工智能 1 分鐘 ★ 87
具身智能 数据集 触觉感知 VTLA
ACL 2026 | OPeRA Dataset: LLM 真的能模仿人类行为了吗?首次系统评估 LLM 的人类行为模拟能力
📌 一句话摘要 本文介绍了 ACL 2026 收录的 OPeRA 数据集,这是一个通过记录真实用户在线购物行为轨迹来系统评估大语言模型模拟人类决策能力的数据集与评测框架,揭示了当前 LLM 在细粒度、个性化行为预测上的显著不足。 📝 详细摘要 文章报道了 ACL 2026 会议上的一项研究,该研
📅 2026-04-17 11:03 (04-17 11:03) 机器之心 人工智能 2 分鐘 ★ 88
LLM 人类行为模拟 评测数据集 OPeRA
ARC Prize 开源 ARC-AGI-3 人类基准数据集
📌 一句话摘要 ARC Prize 正式开源了迄今为止最全面的 ARC-AGI-3 人类基准数据集,引入了新的度量标准并改进了评分规则。 📝 详细摘要 这条推文转述了 ARC Prize 组织的一个重要动态:开源 ARC-AGI-3 人类基准数据集。该数据集是 ARC-AGI 系列中迄今为止最全
📅 2026-04-15 08:50 (04-15 08:50) Berryxia.AI 人工智能 1 分鐘 ★ 79
ARC Prize AGI 基准测试 数据集
36.4 万超声图文对!中国团队构建首个大规模超声专属数据集,让 AI 真正读懂临床诊断语义
📌 一句话摘要 中国多机构联合团队构建了首个大规模、100% 专用于超声影像的图文数据集 US-365K,并提出了语义感知对比学习框架 Ultrasound-CLIP,旨在解决超声 AI 领域的数据稀缺和语义对齐难题,相关成果被 CVPR 2026 接收。 📝 详细摘要 本文介绍了一项由浙大城市
📅 2026-04-12 15:21 (04-12 15:21) 西风 人工智能 2 分鐘 ★ 89
医疗AI 超声影像 多模态大模型 数据集
中国具身模型狂揽全球第一!机器人的人类数据时代来了
📌 一句话摘要 灵初智能发布首个大规模人类手部操作数据集(10 万小时)及 Psi 双系统架构,其模型 Psi-R2 在权威评测 MolmoSpace 中登顶,为具身智能的落地提供了一条基于人类数据的新路径。 📝 详细摘要 文章报道了灵初智能在具身智能领域的最新突破。该公司构建了首个可用于预训练
📅 2026-04-11 10:07 (04-11 10:07) 鹭羽 人工智能 2 分鐘 ★ 88
具身智能 机器人 人类数据 数据集
Hugging Face CEO 分享 1.5 亿条开源智能体推理轨迹
📌 一句话摘要 Clement Delangue 重点介绍了来自 Lambda 和 Nous Research 的全新开源数据集,包含 1.5 亿个 Token 的智能体推理轨迹,旨在支持开源智能体的发展。 📝 详细摘要 这条推文推广了 AI 智能体生态系统中一项重要的开源贡献。Clement
📅 2026-04-08 01:57 (04-08 01:57) clem 🤗 人工智能 1 分鐘 ★ 86
开源 AI 智能体 推理轨迹 Hugging Face
众包开源智能体数据集
📌 一句话摘要 Clément Delangue 呼吁社区通过分享智能体轨迹,为前沿智能体构建开源数据集。 📝 详细摘要 Hugging Face 首席执行官 Clément Delangue 指出,数据获取是开发开源智能体模型的主要瓶颈。他提出了一个社区驱动的解决方案:众包智能体轨迹。通过分享
📅 2026-04-06 23:28 (04-06 23:28) clem 🤗 人工智能 1 分鐘 ★ 82
AI 智能体 开源 Hugging Face 数据集
Hugging Face CEO 呼吁构建众包开源智能体数据集
📌 一句话摘要 Clement Delangue 发起了一项社区行动,旨在构建最大的众包开源智能体数据集,以解决开源 AI 领域严峻的数据瓶颈问题。 📝 详细摘要 Hugging Face 首席执行官 Clement Delangue 指出,开源智能体模型目前极度缺乏数据。他以身作则,分享了自己
📅 2026-04-07 00:22 (04-07 00:22) clem 🤗 人工智能 1 分鐘 ★ 90
HuggingFace 开源 AI 智能体 数据集