微新创想(idea2003.com) 7月17日消息:Meta 正在继续推进对新形式生成式人工智能模型的研究,并公布了最新成果,名为 CM3leon(发音类似于「chameleon(变色龙)」)

图片来自Meta

CM3leon 是一个用于文本到图像创建和图像到文本创建的多模态基础模型,对于自动生成图像标题非常有用。

人工智能生成的图像在当前已经不是新概念,广泛可用的工具如 Stable Diffusion、DALL-E 和 Midjourney 已经取得了很大成功。

新鲜的是 Meta 正在使用构建 CM3leon 的技术以及 Meta 声称该基础模型能够实现的性能。

当前文本到图像生成技术主要依赖 diffusion 模型(Stable Diffusion 的名称源自此)来创建图像。CM3leon 则采用了不同的方法:基于 token 的自回归模型。

Meta 的研究人员在一篇名为《Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning》的研究论文中写道:「近年来,由于性能强大且相对计算成本较低,diffusion 模型在图像生成工作中占据主导地位。相比之下,众所周知基于 token 的自回归模型也能产生出色的结果,尤其在全局图像连贯性方面更好,但训练和推理的成本要高得多。」

Meta 的研究人员已经能够通过 CM3leon 实际演示基于 token 的自回归模型实际上可以比基于 diffusion 模型的方法更高效。

Meta 的研究人员在一篇博客文章中写道:「尽管使用的计算资源比之前基于 Transformer 的方法少了五倍,CM3leon 在文本到图像生成方面实现了最先进的性能。

CM3leon 的基本工作原理在某种程度上与现有的文本生成模型类似。

Meta 的研究人员首先进行了一个检索增强的预训练阶段。与仅从互联网上收集公开可用的图像不同,这种方法已经给基于 diffusion 模型的模型带来了一些法律挑战,Meta 选择了一条不同的道路。

Meta 的研究论文指出:「在文本到图像生成领域,图像数据来源的道德影响已经引发了广泛的讨论。在本研究中,我们只使用 Shutterstock 上的经过授权的图像。因此,我们可以避免与图像所有权和归属相关的担忧,同时不会牺牲性能。

在预训练之后,CM3leon 模型经过一阶段有监督微调(SFT),Meta 的研究人员声称这种方法产生了高度优化的结果,无论是资源利用还是图像质量。SFT 是 OpenAI 用于训练 ChatGPT 的一种方法。Meta 在研究论文中指出,SFT 用于训练模型理解复杂提示,在生成任务中非常有用。

论文中指出:「我们发现,指导调整显著提高了多模态模型在图像标题生成、视觉问答、基于文本的编辑和条件图像生成等各种任务中的性能。」

通过查看 Meta 在关于 CM3leon 的博客文章中分享的生成图像样本集,结果令人印象深刻,清楚地显示了模型理解复杂的多阶段提示,从而生成了分辨率极高的图像。

目前,CM3leon 仍然是一个研究项目,尚不清楚 Meta 是否会在其平台的一个服务中公开提供这项技术。鉴于它的强大性能和更高的生成效率,CM3leon 及其生成式人工智能方法有可能超越研究阶段最终得到应用。

最新快讯

2025年10月03日

00:03
摩根士丹利最新发布的权威报告揭示了一个令人振奋的市场信号:苹果iPhone 17及Pro系列的需求表现远超预期,供应链数据也呈现出强劲的出货态势。分析师Erik Woodring基于详实的Apple Store发货周期追踪和供应链反馈指出,iPhone 17、17 Pro和17 Pro Max在初期市场反响热烈,其强劲的需求势头已促使苹果公司调整生产计划,预...

2025年10月02日

23:30
据游戏媒体Insider Gaming独家披露的内部文件显示,索尼互娱正酝酿一项重大战略调整,计划逐步缩减PS4游戏机的部分在线服务功能。文件内容揭示,自2026年春季起,所有新提交的PS4游戏将不再支持包括活动流Web API、用户存储、共享媒体在内的六项旧版PSN功能。这一决策的核心目标是为不同世代的主机用户构建更为统一的服务平台,从而优化整体用户体验。...
23:00
2025年10月2日,全球外卖市场迎来重磅消息美国科技巨头DoorDash正式宣布完成对英国头部外卖平台Deliveroo的收购这一交易在伦敦证券交易所完成,总金额高达数十亿美元,堪称行业并购史上的里程碑事件。作为全球最大的外卖服务平台,DoorDash通过此次战略性收购,不仅将业务版图拓展至欧洲核心市场,更在关键区域实现了市场份额的显著提升。值得注意的是,...
23:00
截至2025年10月2日,国庆档期累计票房(含预售)已强势突破7亿元大关,这一亮眼成绩不仅彰显了观众的观影热情,更凸显了电影市场的蓬勃活力。今年国庆档期从10月1日持续至10月8日,期间多部备受期待的新片集中上映,引发了观影热潮,各大影院场场爆满,座无虚席。这一票房佳绩充分反映了观众对优质内容的强烈渴求,也标志着电影市场迈入了一个重要增长节点,预示着未来电影...
23:00
10月2日,正值国庆假期第二天,全国道路交通流量虽较首日有所回落,但整体仍处于高位运行状态。特别是长三角、珠三角等经济发达区域,路网压力持续增大,部分城市出城通道、城郊路段以及热门旅游景区周边道路出现明显拥堵排队现象,严重影响出行效率。针对当前交通态势,公安部交通管理局已紧急部署专项疏导方案,通过增派警力、优化信号灯配时、实时发布路况信息等措施,全力保障群众...
23:00
10月2日,广东省迎来旅游小高峰,全省4A级及以上景区共接待游客461.5万人次,展现出强劲的旅游市场活力。当日,广州长隆、深圳欢乐谷、清远英西峰林等热门景区客流集中,各地文旅部门提前部署,通过增派安保力量、优化交通疏导、增设应急服务点等措施,全力保障游客游览体验与安全。这一数据不仅印证了民众出行需求的持续释放,更凸显了文旅市场强劲复苏的积极态势,为全年旅游...
23:00
苹果iPad用户们,一个令人振奋的消息即将改变您的创作体验——Affinity 2系列图像编辑工具今日正式开启限时免费活动!这款备受业界赞誉的专业级应用套件,包含三款核心工具,现可通过内购方式永久免费获取授权,让您彻底摆脱订阅束缚,畅享无限创作可能。 Affinity Photo 2堪称移动端Photoshop的完美替代品,它不仅继承了桌面级照片编辑的强大功...
23:00
最新消息显示,三星即将推出的Galaxy S26 Ultra将搭载一项突破性的隐私保护功能,该功能能够在用户进入电梯、公交车、地铁等公共场合时自动激活,有效防止屏幕内容被窥视,为用户隐私提供全方位守护。这一创新功能的核心亮点在于其智能检测机制,用户可以根据实际需求调整检测强度,同时支持自定义排除项,例如锁屏验证方式、特定图片、通知内容或画中画窗口,确保在保护...
23:00
宾利正式官宣旗下顶级双门跑车欧陆GT Supersport将强势回归,为所有极致性能追求者献上旗舰级驾驶盛宴。这一标志性车型曾因品牌战略转向插电混动技术而暂时搁置,但面对全球车迷对纯粹机械性能的执着热爱,宾利最终决定重启这一传奇项目。新车由宾利摩斯港(Motorsport)部门倾力打造,通过全面优化底盘结构、悬挂系统与制动性能,更配备主动式扰流板与精密进气设...
23:00
2025年10月2日,迪士尼集团正式宣布一项具有里程碑意义的战略决策——Hulu将全面接替Star,成为Disney+平台的全球综合娱乐品牌。这一重大调整不仅标志着迪士尼在全球流媒体市场版图的一次深刻变革,更体现了其统一内容品牌标识、优化用户体验的长期愿景。据悉,此前作为迪士尼国际内容品牌的主力军Star,主要聚焦于面向成年观众的高质量影视作品。然而随着Hu...
21:58
微新创想10月2日讯 特斯拉近日发布了2025年第三季度的交付报告,最终交付量高达497,099辆,这一数字远超市场此前预测的439,612辆,展现出强劲的市场表现。从车型分布来看,Model 3和Model Y作为特斯拉的核心产品,继续引领交付量,第三季度累计交付481,166辆,占总交付量的96.8%。其中Model 3/Y的产量达到435,826辆,显...
21:58
10月2日,一则令人意想不到的新闻在浙江杭州引发广泛关注:一只体重高达128斤的金毛犬"圆圆"在遭遇车祸时,竟奇迹般毫发无损。这场意外中,"圆圆"的脂肪层发挥了惊人的保护作用,这一奇特现象迅速成为网络热议焦点。 监控视频记录了事发经过:当时"圆圆"正在马路中间休息,由于恰好处于驾驶员的视野盲区,一辆黑色日产轩逸在倒车时车轮不慎压在了它身上。附近邻居听到狗狗的...