茂名管道保温 三类视觉Token分拨,能径直处理压缩时序碎屑化 - 北京设备保温施工_鑫诚防腐保温工程有限公司
北京设备保温施工_鑫诚防腐保温工程有限公司
北京设备保温施工_鑫诚防腐保温工程有限公司

茂名管道保温 三类视觉Token分拨,能径直处理压缩时序碎屑化

2026-07-31 05:39:26

茂名管道保温 三类视觉Token分拨,能径直处理压缩时序碎屑化
铁皮保温施工

长认知茂名管道保温,正在成为多模态大模子的垂死智商。

用户初始不再只问"里有什么",而是但愿模子能跨越回答:这个事件从什么手艺初始?到什么手艺适度?这类任务被称为时序定位(Video Temporal Grounding, VTG)。

但越长,visual tokens 越多,理资本也越。

个径直想路是:剪掉部分视觉 token。

SemVID 恰是围绕这个问题张开。它的中枢不雅点是:比较传统针对 VideoQA 的剪枝,VTG 剪枝不是通俗删掉"不垂死画面",而是要保住条相沿时辰定位的 evidence chain。该责任已被 ECCV 2026 会议请托。

VideoQA 剪枝和 VTG 剪枝,根柢倡导不同

以往好多 token pruning 法主要就业于 VideoQA。VideoQA 的倡导常常是回答"里有什么""东谈主物在作念什么""物体是什么颜"。这类问题时时只需要少数要道帧展示相干画面就可能答对。

但 VTG 的倡导不同。VTG 要定位"什么手艺初始、什么手艺适度"。模子不仅要看到 query 相干对象,还要看到行为前后的景况变化。

比如查询是"个东谈主从柜子里拿出包",模子不仅要看到"东谈主""柜子""包",还要看到行为发生前后的景况变化:手什么手艺伸向柜子,包什么手艺被拿出。

若是剪枝法只保留几个著或相干的画面,模子可能知谈事件如实出现过,却法判断准确领域。

换句话说,VideoQA 剪枝回答的是:哪些画面够回答问题?VTG 剪枝真确要回答的是:哪些根据能相沿时辰定位?

这便是 SemVID 与既有法的根柢各异。

SemVID 的中枢动机:保住 Evidence Chain

下图展示了 SemVID 的中枢 motivation,即 VTG 需要的不仅仅局部根据,而是条跨帧勾通的根据链。

在 VTG 中,事件时时不是由著的某几帧决定的,而是由系列景况变化共同界说的。

事件领域隔壁的 token 隆重告诉模子"变化从这里初始和适度",而中间的 relay token 隆重勾通前后景况。

旦这些中间节点被剪掉茂名管道保温,根据链就会断裂。模子可能仍然看到若干相干画面,却圭表地将这些画面关联起来,构成一语气理旅途。

成果便是:语义认知还在,时辰定位变差。

因此,SemVID 提议两个面向 VTG 的剪枝倡导,意于构成相沿定位的根据链:

Evidence Retention:保留与 query 语义度相干的 token,尤其是事件领域隔壁的要道根据。

Connectivity Strength:保留跨帧勾通,让根据能沿时辰传播,而不是造成孤独孤身一人碎屑。

法:从语义角度分别每个 token 在中的角

围绕根据链,SemVID 绸缪了个 training-free token pruning 框架。它不需要重新熟谙 backbone,只在理阶段决定保留哪些视觉 token。

整个法分两步。

先决定每帧保留若干 token

若是平平分拨预算,关片断会浮滥 token;若是只根据 query 相干度,预算又可能鸠合到少数相干帧,致中间帧被剪空,时辰链路断裂。

SemVID 因此同期辩论 query 相干度和帧间变化两个信号。

相干帧包含倡导事件,而变化帧时时辘集行为升沉或事件领域,从而保证预算分拨涵盖齐全时辰轴和根据链。

在每帧里面经受具体 token

如下图所示,SemVID 式保留三类语义角不同的 token:Object、Motion 和 Context。

Object token保留与 query 相干的对象根据,隆重回答"发生了什么"。

为了止反复选中同物体隔壁的 patch,致预算被雷同的局部区域占满,SemVID 使用 MMR,让选出的 object token 既相干又互补,从而袒护齐全的对象根据。

Motion token保留行为升沉茂名管道保温,隆重回答"什么手艺发生变化"。

SemVID 根据相邻帧之间的局部特征变化经受 motion token,铁皮保温并结合相干渡过滤与 query 关的布景洞开。

它们不是宽泛洞开区域,而是勾通事件前后景况的 relay node。

Context token保留场景锚点,隆重回答"根据发生在什么环境中"。

端剪枝下,若是只留住对象局部,会造成组碎屑化根据。极少 context anchor 不错保管场景一语气,匡助模子把对象和行为放回正确语境中。

履行:SemVID 是否真实保住了根据链?

论文在 Charades-STA 和 ActivityNet-Grounding 上使用 Qwen3-VL 和 Qwen2.5-VL 进行评测。履行考据了 SemVID 是否在强压缩下仍能保执 VTG 所需的领域定位智商。

上图标明在疏浚 token 预算下,SemVID 在 mIoU、ER 和 CS 上举座于现存剪枝法。

尤其在低保留率下,其他法时时出现明能着落;而 SemVID 仍能褂讪保执较 mIoU。这证据 SemVID 的势不仅仅"压缩 token ",而是把有限 token 留在了真确影响时辰定位的位置。

其中,mIoU 商酌终定位精度,ER 商酌要道根据是否被保留,CS 商酌根据是否能跨帧连起来。

不错看到,SemVID 的 mIoU 晋升常常跟随 ER 和 CS 的晋升,这与团队的中枢动机致:VTG 剪枝不行只保留相干画面,还必须保留条可跟踪的 evidence chain。

消融履行跨越讲明了 SemVID 为什么有。

去掉 Object Token 后,mIoU 和 ER 着落,证据 query 相干的对象根据是定位基础;去掉 Motion Token 后,mIoU 和 CS 着落明,证据行为变化 token 是勾通事件前后景况的要道 relay;去掉 Context Token 后,CS 也会着落,证据极少场景锚点能匡助保管时辰一语气,避根据碎屑化。

可视化:SemVID 能褂讪保留行为相干根据

下图展示了不同剪枝法的 attention 热力争。

比较 VisionZip 和 FastVID,SemVID 即使在 12.5 的低预算下,仍能褂讪聚焦在行为发生前后的语义相干区域,举例东谈主物手部、物体和行为交互位置。

追思

SemVID 垂死的启发是,VTG 剪枝不行只保留"看起来相干"的画面,而要保留能相沿领域定位的根据链。

通过 object/motion/context 三种语义角,SemVID 能在 training-free 条目下,把有限 token 准确地分拨给对象根据、行为升沉和场景锚点,从汉典毕褂讪的永劫序定位。

诚然,SemVID 也还有跨越矫正空间。现时 motion token 主要依赖帧间特征变化来描写洞开,在镜头移动、布景剧烈变化或遮盖较多的场景中,仍可能受到骚扰。

论文标题:Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding

论文作家:Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan

作家单元:University of Warwick;University of Amsterdam;Amazon AGI

论文地址:https://arxiv.org/abs/2603.05663

代码地址:https://github.com/JiaqiLi404/SemVID

键三连「点赞」「转发」「严防心」

宽贷在挑剔区留住你的想法!

—  完  —

【学术投稿】请在责任日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉咱们:你是谁,从哪来,投稿本色附上技俩 / 主页联结,以及磋磨式。

� �   咱们会 ( 尽量 ) 实时回话你 : )

� � 点亮星标 � �

科技前沿发扬逐日见邮箱:215114768@qq.com相关词条:储罐保温     异型材设备     钢绞线厂家    玻璃丝棉厂家    万能胶厂家

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定茂名管道保温,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。