阿里巴巴与南开大学联手研发LLaVA-Scissor视频大模型压缩技术

近日,阿里巴巴通义实验室携手南开大学计算机科学学院共同推出了一项突破性的视频大模型压缩技术——LLaVA-Scissor。这一创新成果旨在有效应对视频模型处理过程中所面临的核心挑战,特别是传统方法在处理视频帧时因高 token 数量而导致的推理速度缓慢和扩展性不足等问题。视频模型需要对每一帧进行独立编码,这种序列化处理方式使得 token 数量急剧增长,给计算资源带来了巨大压力。

阿里巴巴与南开大学联手研发LLaVA-Scissor视频大模型压缩技术插图1

尽管传统的 token 压缩技术如 FastV、VisionZip 和 PLLaVA 等在图像领域取得了显著进展,但在视频理解任务中却暴露出语义覆盖不足和时序冗余等突出问题。为了突破这些瓶颈,LLaVA-Scissor 采用了一种基于图论的创新算法——SCC 方法,能够精准识别 token 集合中的不同语义区域。通过计算 token 之间的相似性,构建相似性图,并识别图中的连通分量,该方法能够将每个连通分量中的多个 token 替换为代表性 token,从而大幅减少 token 数量,显著提升处理效率。

为了进一步提升压缩效果,LLaVA-Scissor 采用了两步时空压缩策略。在空间压缩阶段,系统会对每一帧进行语义区域的精准识别,而在时间压缩阶段则专注于去除跨帧的冗余信息。这种双管齐下的压缩方式确保了最终生成的 token 能够高效地表示整个视频的完整语义,既保留了关键信息,又大幅降低了计算复杂度。

阿里巴巴与南开大学联手研发LLaVA-Scissor视频大模型压缩技术插图2

在实验验证方面,LLaVA-Scissor 在多个权威视频理解基准测试中展现了卓越性能,特别是在低 token 保留率下的优势尤为突出。例如,在视频问答基准测试中,该模型在仅保留50% token的情况下,性能与原始模型相当,而在35%和10%的保留率下,其表现更是超越了其他竞争方法。在长视频理解测试中,LLaVA-Scissor 同样表现出色,在 EgoSchema 数据集上,当 token 保留率仅为35%时,准确率仍能达到57.94%。这些优异表现充分证明了该技术的创新性和实用性。

这一创新的压缩技术不仅显著提升了视频处理的效率,更为未来视频理解和处理领域的发展开辟了新的方向。LLaVA-Scissor 的推出,无疑将为视频人工智能领域带来深远影响,推动相关技术的进一步突破和应用拓展。划重点:? LLaVA-Scissor 是阿里巴巴与南开大学联合研发的创新视频大模型压缩技术,专门针对传统方法中 token 数量激增的问题提供高效解决方案。  ? SCC 方法通过计算 token 相似性,构建图并识别连通分量,能够精准减少 token 数量,同时保留关键语义信息。  ? LLaVA-Scissor 在多个视频理解基准测试中表现卓越,尤其在低 token 保留率下展现出显著性能优势,为视频人工智能领域树立了新的标杆。

最新快讯

2025年11月28日

10:36
声明:本文来自于微信公众号 Tech星球,作者:林京,授权站长之家转载发布。Jellycat门店正在加快扩张。近一个月内,作为Jellycat国内最大的代理商之一,JOYCODE门店在北京各个商圈密集铺开,其官方数据显示,直营门店数量已经达20+。比肩以自有IP为主的泡泡玛特,Jellycat毛利率达到近70%,其最新财报显示,...
10:36
声明:本文来自于微信公众号 卡思数据,作者:毕十三,授权站长之家转载发布。烈火烹油的短剧行业,正在捧起一个又一个新晋顶流。艺恩营销智库数据显示,短剧行业年播放量突破500亿次,用户规模超8亿,形成了独特的内容生态和受众群体。短剧造星的效率远超传统影视。DataEye研究院估算,传统平台捧红一个影视明星需1、2亿的成本,而在微短剧...
10:36
声明:本文来自于微信公众号 壹娱观察,作者:大娱乐家,授权站长之家转载发布。同步北美上映的《疯狂动物城2》,其国内预售票房让好莱坞电影重温到了美好的旧时光:据猫眼专业版数据,其预售票房(含零点场)超3.091亿,超越《哪吒之魔童闹海》刷新中国影史动画电影预售票房纪录。当下的讨论度和观众期待值多少让人想起了2020之前好莱坞电影在...
10:36
DeepSeek今日震撼发布全新升级的DeepSeek-Math-V2模型,这款拥有6850亿参数的混合专家(MoE)架构,成功开创了开源数学推理大模型的新纪元,成为全球首个以开源形式达到国际数学奥林匹克(IMO)金牌水平的AI系统。该模型基于DeepSeek-V3.2实验版架构精心打造,全面采用Apache2.0开源协议,完整公开所有模型权重,在数学推理能...
10:36
2025年初,全球科技公司曾一度笼罩在美国总统特朗普贸易关税政策的阴影之下。然而,自10月起,市场焦点迅速转向人工智能(AI)领域,对AI泡沫的担忧成为主流话题。投资者开始对AI公司的高估值保持高度警惕,这一转变在软银集团的股价暴跌中得到了集中体现。 作为深度布局AI领域的日本科技巨头,软银自10月31日至11月26日期间股价遭遇断崖式下跌,跌幅高达40%,...
10:35
2025年11月28日,福建省正式发布《“十五五”规划建议》,明确提出将启动新一轮国有企业改革专项行动,旨在全面提升国有资本运营效率和企业综合实力。此次改革的核心目标在于做强做优做大国有资本和国有企业,通过优化国有经济布局和结构调整,进一步释放国有企业的市场活力和发展潜力。 改革方案将重点围绕以下几个方面展开。首先,加快省属国有企业的战略性重组和专业化整合,...
10:35
2025年11月28日,全球领先的支付技术公司Juspay与Sabre Corporation旗下知名品牌Sabre Direct Pay正式宣布达成一项具有里程碑意义的全球战略合作协议。此次合作将深度融合Juspay先进的支付编排技术平台与Sabre强大的全球旅行网络资源,共同致力于推动旅游企业支付效率与客户体验的全面提升。根据协议内容,双方将重点整合本地...
10:35
2025年11月27日,美国犹他州一家名为“DVD Game Exchange”的维修中心发生了一起令人震惊的电子设备虫害事件。工作人员在检修一台PS5游戏机时,意外发现其内部竟然被蟑螂严重侵蚀,不仅布满了黏腻的蟑螂粪便,更有多只活体蟑螂在机内爬行。面对这一令人作呕的场景,技术人员立即对设备进行了拆解检查,最终确认正是蟑螂的入侵导致了PS5的内部电路短路和功...
10:35
2025年11月28日,一条连接贵州西南部的重要交通动脉——盘州至兴义高铁(盘兴高铁)正式宣告通车,这一历史性时刻不仅拉近了盘州与兴义两地的时空距离,更标志着贵州省九个市州中心城市实现了高铁网络的全面覆盖,开启了“市市通高铁”的新篇章 盘兴高铁全长99公里,犹如一条钢铁巨龙蜿蜒穿行于贵州高原的山水之间,设计时速高达250公里,沿线设有盘州站、保田站和兴义...
10:35
2025年11月28日,仙工智能正式向香港交易所提交招股书,正式宣告进军资本市场。作为智能生产和智慧物流领域的领军企业,仙工智能致力于为全球工业客户提供全方位的智能化解决方案。其核心产品体系涵盖通用自主移动机器人控制器、自动化叉车系统、可视化工业管理系统软件以及智能视觉解决方案,形成了一站式智能工业解决方案矩阵。此次IPO是仙工智能发展历程中的重要里程碑,将...
10:35
2025年11月28日,北京市正式发布《促进“人工智能+视听”产业高质量发展行动方案(2025—2029年)》,为未来五年北京在该领域的战略布局描绘了清晰蓝图。方案明确提出将加快算法模型技术的突破性进展,通过系统性创新驱动产业升级。北京将集中资源重点推进“人工智能+视听”领域垂直类大模型的研发进程,这一举措旨在打造具有自主知识产权的核心技术体系。 方案特别强...
10:35
2025年第四季度,启迈QIMA发布的行业报告揭示了全球采购格局的深刻变化。数据显示,自8月起美国海外采购活动明显放缓,其在中国进行的检验与审核量同比下降了24%。这一变化主要源于全球供应链持续性的转移趋势。与之形成鲜明对比的是,拉丁美洲和南美洲地区的采购需求却呈现强劲增长态势。其中,巴西、阿根廷和乌拉圭对中国供应商的检验需求分别增长了54%、16%和69%...