Meta 释放“AI 视觉 GPT 时刻”:SAM 3D 一键重建世界,SAM 3 引爆图像分割革命
智东西 11 月 20 日报道——Meta 今日正式推出全新 3D 重建模型家族 SAM 3D,包括面向物体与场景重建的 SAM 3D Objects,以及人体三维估计模型 SAM 3D Body。
更震撼的是,新模型只需用户 在图像上点击一下,就能从一张 2D 照片中直接扣出一个 可 360° 观看、几乎无破绽的 3D 模型。
与此同时,备受关注的 SAM 3(下一代 2D 分割模型)也同步发布,引入了极具突破性的 「可提示概念分割」。
Meta 的最新动作被业内形容为 “计算机视觉的 ChatGPT 时刻”。
🧩 01. SAM 3D:点击一下,从 2D 到 3D
SAM(Segment Anything Model)一直是分割模型的行业标杆。此前开源的 SAM 1 / SAM 2 已经统治了 2D 分割领域。
如今推出的 SAM 3D Objects 可以从自然图像中自动完成三维重建:
- 一张图像 → 一个完整的 3D 网格模型
- 能重建形状、纹理、姿态
- 360° 旋转几乎看不到破绽
- 小物体、遮挡、逆视角也能处理
为突破传统 3D 数据稀缺的瓶颈,Meta 构建了史上最大规模 3D 标注体系:
🔹 近百万张图像
🔹 314 万个 3D 网格模型
🔹 结合“众包 + 专家 3D 艺术家”的混合标注方式
🔹 自建 SA-3DAO 艺术家级数据集提升基准难度
更创新的是,它借鉴大模型训练思路,将 大规模合成数据的预训练 与 真实数据微调 结合,形成数据与模型互相强化的闭环。
性能测试中,SAM 3D Objects 以 5:1 的人类偏好比碾压现有竞品,并能在 几秒内完成全纹理 3D 重建,让实时 3D 应用(如机器人视觉)真正可行。
🧍 02. SAM 3D Body:可控的人体三维重建
SAM 3D Body 专注于人体三维姿态与体型估计,即使面对:
- 异常姿势
- 遮挡
- 多人场景
- 复杂服饰
依然能稳定输出高精度 3D 人体模型。
核心是 Meta 提出的 MHR(Meta Momentum Human Rig)开源人体网格格式,将骨骼结构与软组织形状解耦,增强可解释性。
它支持提示输入(提示掩码、关键点等),让三维结果更可控、更易交互。
数据方面,SAM 3D Body 使用了:
- 数十亿张图像
- 多机位高质量视频
- 专业级合成数据
- 自动化 3D 数据引擎筛选稀有姿态
最终形成 约 800 万张高质量训练样本。
测试表明,该模型在多项人体基准上全面领先,但目前仍不支持多人交互、物体接触推理,未来版本将进一步补齐。
🎨 03. SAM 3:图像分割“进化成语言模型”
相比 3D 系列,SAM 3 是 Meta 对 2D 分割的重大升级。
🧠 最大突破:支持“概念级提示分割”
传统分割只能识别预设类别,而 SAM 3 能理解:
- “狗”“大象”“斑马”
- “动物”这种泛概念
- “穿黑外套、戴白帽子的人”这样的复合描述
- “红色条纹伞”这类细粒度概念
它几乎具备类似语言模型的泛化与理解能力。
为此,Meta 发布了 SA-Co(Segment Anything with Concepts) 大词汇量基准,用于检验开放式概念分割能力。
SAM 3 的提示形式多样:
- 文本输入
- 示例图像
- 掩码 / 框选等视觉提示
测试显示:
- SAM 3 在 SA-Co 中的概念分割性能提升 约 100%
- 用户偏好测试中,相比强劲对手 OWLv2 的优势达到 3:1
- 在旧任务(如 SAM 2 分割、零样本 LVIS、目标计数)中也保持领先
数据构建方式也全面进化:
Meta 使用 “AI + 人类”混合标注流水线:
- SAM 3 + Llama 3.2v 先生成初稿
- 人类和 AI 注释者共同完善
- AI 注释速度比人类快 4 倍
同时利用 Wikipedia 概念本体扩展稀有概念的覆盖范围。
⚙️ 04. 开源、架构、应用:从实验室到 Facebook 市场
Meta 已将 SAM 3D 与 SAM 3 全面开放:
- 数据集
- 模型检查点
- 推理代码
- 参数化人体模型(MHR)
- 微调工具
架构上,SAM 3 整合了多项先进组件:
- Meta Perception Encoder
- DETR 检测器
- SAM 2 记忆模块用于跟踪
- 统一模型实现检测 + 分割 + 跟踪,不冲突且高效
更重要的是,Meta 已将模型直接接入产品链路:
🛋️ Facebook Market 上线“房间视图”功能
用户可以买家具前直接用 SAM 3D 在家中虚拟摆放,判断风格与合适度。
这意味着 SAM 技术首次进入真正的商业落地阶段。



