声明:本文来自于微信公众号 量子位(ID:QbitAI),Semantic-SAM团队投稿,授权微新创想转载发布

比Meta“分割一切”的SAM更全能的图像分割AI,来了!

模型名为Semantic-SAM,顾名思义,在完全复现SAM分割效果的基础上,这个AI还具有两大特点:

  • 语义感知:模型能够给分割出的实体提供语义标签

  • 粒度丰富:模型能够分割从物体到部件的不同粒度级别的实体

用作者自己的话说:

Semantic-SAM,在多个粒度(granularity)上分割(segment)和识别(recognize)物体的通用图像分割模型。

据我们所知,我们的工作是在 SA-1B数据集、通用分割数据集(COCO等)和部件分割数据集(PASCAL Part等)上联合训练模型的首次尝试,并系统研究了在SA-1B 上定义的交互分割任务(promptable segmentation)和其他分割任务(例如,全景分割和部件分割)上多任务联合训练的相互促进作用。

论文来自香港科技大学、微软研究院、IDEA研究院、香港大学、威斯康星大学麦迪逊分校和清华大学等研究单位。

具体详情,一起来看~

  • 论文地址:https://arxiv.org/abs/2307.04767

  • 代码地址:https://github.com/UX-Decoder/Semantic-SAM

  • 在线Demo地址:上述代码仓库的首页

(以下为论文作者投稿)

简介

Semantic-SAM可以完全复现SAM的分割效果并达到更好的粒度和语义功能,是一个强大的vision foundation model。Semantic-SAM 支持广泛的分割任务及其相关应用,包括:

  • Generic Segmentation 通用分割(全景/语义/实例分割)

  • Part Segmentation 细粒度分割

  • Interactive Segmentation with Multi-Granularity Semantics 具有多粒度语义的交互式分割

  • Multi-Granularity Image Editing 多粒度图像编辑

1.1复现SAM

SAM是Semantic-SAM的子任务。我们开源了复现SAM效果的代码,这是开源社区第一份基于DETR结构的SAM复现代码。

1.2超越SAM

  • 粒度丰富性: Semantic-SAM能够产生用户点击所需的所有可能分割粒度(1-6)的高质量实体分割,从而实现更加可控和用户友好的交互式分割。

  • 语义感知性。Semantic-SAM使用带有语义标记的数据集和SA-1B数据集联合训练模型,以学习物体(object)级别和细粒度(part)级别的语义信息。

  • 多功能。Semantic-SAM 实现了高质量的全景,语义,实例,细粒度分割和交互式分割,验证了SA-1B 和其他分割任务的相互促进作用。

只需单击一下即可输出多达6个粒度分割!与 SAM 相比,更可控地匹配用户意图,不用担心鼠标移动很久也找不到想要的分割了~

2. 模型介绍

2.1模型结构

Semantic-SAM的模型结构基于Mask DINO进行开发。Mask DINO是基于DETR框架的统一检测和分割的网络,目前仍然是相同模型size下的SOTA模型。Semantic-SAM的模型结构主要改进在decoder部分,同时支持通用分割和交互式分割。通用分割的实现与Mask DINO相同。交互式分割包括point和box两种形式,其中box到mask不存在匹配的ambiguity,实现方式与通用分割相同,而point到mask的匹配是Semantic-SAM的关键设计。

在Semantic-SAM中,用户的point输入被转换成6个prompt, 每个prompt包含一个可学习的level embedding进行区分。这6个prompt通过decoder产生6个不同粒度的分割结果,以及object和part类别。

2.2训练

为了学到物体级别(object)和部件级别(part)的语义,Semantic-SAM同时从多个数据集中进行学习,如多粒度数据集(SA-1B),物体级别数据集(如COCO),以及部件级别数据集(如Pascal Part)。

为了从联合数据集中学习语义感知性和粒度丰富性,我们引入以下两种训练方法:

解耦物体分类与部件分类的语义学习:为了学习到可泛化的物体和部件语义,我们采用解耦的物体分类和部件分类,以使得只有object标注的数据也可以学习到一些通用的part语义。例如,head是在几乎所有动物上都通用的part,我们期望模型从有标注的dog head,cat head,sheep head等head中学习到可泛化的lion,tiger,panda等head的识别能力。

Many-to-Many的多粒度学习:对于交互式分割中的point输入,Semantic-SAM利用6个prompt去输出多粒度的分割结果,并用包含该点击的所有标注分割来作为监督。这种从多个分割结果到多个分割标注的Many-to-Many的匹配和监督,使得模型能够达到高质量的多粒度分割效果。

3. 实验

3.1SA-1B 与通用分割数据集的联合训练

我们发现,联合训练 SA-1B 和通用分割数据集可以提高通用分割性能,如对COCO分割和检测效果有大幅提升。

在训练SA-1B数据的过程中,我们也发现了利用少量SA-1B的数据即可得到很好的效果。

3.2SA-1B 与细粒度分割数据集的联合训练

同样的,联合训练 SA-1B 和细粒度分割数据集可以提高部件分割性能。

4. 可视化

4.1Semantic-SAM的prompt从大量数据中学到了固定模式的表征

Semantic-SAM一共有6个可学习的prompt。对于不同图片的点击,观察每个prompt对应的分割结果,可以发现每个prompt的分割都会对应一个固定的粒度。这表明每个prompt学到了一个固定的语义级别,输出更加可控。

4.2Semantic-SAM与SAM, SA-1B Ground-truth 的比较

每行最左边图像上的红点是用户点击的位置,(a)(b) 分别是Semantic-SAM和 SAM 的分割输出, (c) 是包含用户点击的 Groud-truth 分割。与 SAM 相比,Semantic-SAM具有更好的分割质量和更丰富的粒度,方便用户找到自己需要的分割粒度,可控性更好。

最新快讯

2025年10月03日

00:03
摩根士丹利最新发布的权威报告揭示了一个令人振奋的市场信号:苹果iPhone 17及Pro系列的需求表现远超预期,供应链数据也呈现出强劲的出货态势。分析师Erik Woodring基于详实的Apple Store发货周期追踪和供应链反馈指出,iPhone 17、17 Pro和17 Pro Max在初期市场反响热烈,其强劲的需求势头已促使苹果公司调整生产计划,预...

2025年10月02日

23:30
据游戏媒体Insider Gaming独家披露的内部文件显示,索尼互娱正酝酿一项重大战略调整,计划逐步缩减PS4游戏机的部分在线服务功能。文件内容揭示,自2026年春季起,所有新提交的PS4游戏将不再支持包括活动流Web API、用户存储、共享媒体在内的六项旧版PSN功能。这一决策的核心目标是为不同世代的主机用户构建更为统一的服务平台,从而优化整体用户体验。...
23:00
2025年10月2日,全球外卖市场迎来重磅消息美国科技巨头DoorDash正式宣布完成对英国头部外卖平台Deliveroo的收购这一交易在伦敦证券交易所完成,总金额高达数十亿美元,堪称行业并购史上的里程碑事件。作为全球最大的外卖服务平台,DoorDash通过此次战略性收购,不仅将业务版图拓展至欧洲核心市场,更在关键区域实现了市场份额的显著提升。值得注意的是,...
23:00
截至2025年10月2日,国庆档期累计票房(含预售)已强势突破7亿元大关,这一亮眼成绩不仅彰显了观众的观影热情,更凸显了电影市场的蓬勃活力。今年国庆档期从10月1日持续至10月8日,期间多部备受期待的新片集中上映,引发了观影热潮,各大影院场场爆满,座无虚席。这一票房佳绩充分反映了观众对优质内容的强烈渴求,也标志着电影市场迈入了一个重要增长节点,预示着未来电影...
23:00
10月2日,正值国庆假期第二天,全国道路交通流量虽较首日有所回落,但整体仍处于高位运行状态。特别是长三角、珠三角等经济发达区域,路网压力持续增大,部分城市出城通道、城郊路段以及热门旅游景区周边道路出现明显拥堵排队现象,严重影响出行效率。针对当前交通态势,公安部交通管理局已紧急部署专项疏导方案,通过增派警力、优化信号灯配时、实时发布路况信息等措施,全力保障群众...
23:00
10月2日,广东省迎来旅游小高峰,全省4A级及以上景区共接待游客461.5万人次,展现出强劲的旅游市场活力。当日,广州长隆、深圳欢乐谷、清远英西峰林等热门景区客流集中,各地文旅部门提前部署,通过增派安保力量、优化交通疏导、增设应急服务点等措施,全力保障游客游览体验与安全。这一数据不仅印证了民众出行需求的持续释放,更凸显了文旅市场强劲复苏的积极态势,为全年旅游...
23:00
苹果iPad用户们,一个令人振奋的消息即将改变您的创作体验——Affinity 2系列图像编辑工具今日正式开启限时免费活动!这款备受业界赞誉的专业级应用套件,包含三款核心工具,现可通过内购方式永久免费获取授权,让您彻底摆脱订阅束缚,畅享无限创作可能。 Affinity Photo 2堪称移动端Photoshop的完美替代品,它不仅继承了桌面级照片编辑的强大功...
23:00
最新消息显示,三星即将推出的Galaxy S26 Ultra将搭载一项突破性的隐私保护功能,该功能能够在用户进入电梯、公交车、地铁等公共场合时自动激活,有效防止屏幕内容被窥视,为用户隐私提供全方位守护。这一创新功能的核心亮点在于其智能检测机制,用户可以根据实际需求调整检测强度,同时支持自定义排除项,例如锁屏验证方式、特定图片、通知内容或画中画窗口,确保在保护...
23:00
宾利正式官宣旗下顶级双门跑车欧陆GT Supersport将强势回归,为所有极致性能追求者献上旗舰级驾驶盛宴。这一标志性车型曾因品牌战略转向插电混动技术而暂时搁置,但面对全球车迷对纯粹机械性能的执着热爱,宾利最终决定重启这一传奇项目。新车由宾利摩斯港(Motorsport)部门倾力打造,通过全面优化底盘结构、悬挂系统与制动性能,更配备主动式扰流板与精密进气设...
23:00
2025年10月2日,迪士尼集团正式宣布一项具有里程碑意义的战略决策——Hulu将全面接替Star,成为Disney+平台的全球综合娱乐品牌。这一重大调整不仅标志着迪士尼在全球流媒体市场版图的一次深刻变革,更体现了其统一内容品牌标识、优化用户体验的长期愿景。据悉,此前作为迪士尼国际内容品牌的主力军Star,主要聚焦于面向成年观众的高质量影视作品。然而随着Hu...
21:58
微新创想10月2日讯 特斯拉近日发布了2025年第三季度的交付报告,最终交付量高达497,099辆,这一数字远超市场此前预测的439,612辆,展现出强劲的市场表现。从车型分布来看,Model 3和Model Y作为特斯拉的核心产品,继续引领交付量,第三季度累计交付481,166辆,占总交付量的96.8%。其中Model 3/Y的产量达到435,826辆,显...
21:58
10月2日,一则令人意想不到的新闻在浙江杭州引发广泛关注:一只体重高达128斤的金毛犬"圆圆"在遭遇车祸时,竟奇迹般毫发无损。这场意外中,"圆圆"的脂肪层发挥了惊人的保护作用,这一奇特现象迅速成为网络热议焦点。 监控视频记录了事发经过:当时"圆圆"正在马路中间休息,由于恰好处于驾驶员的视野盲区,一辆黑色日产轩逸在倒车时车轮不慎压在了它身上。附近邻居听到狗狗的...