MERIT 多键情节记忆改写长视频检索:小时到天级视频,EgoLifeQA 等 3 项基准达 SOTA

MERIT 用「多键情节记忆 + 推理时时间邻域扩展」两步走,在 EgoLifeQA、LVBench 与 Video-MME(Long)三项长视频基准上取得领先表现。它真正的方法论价值不在记忆结构有多精巧,而在于承认一个前提:构建记忆时并不知道用户要问什么,所以把「组织高层语义关系」这件事推迟到提问之后,比提前预建模更划算。

超长视频为什么必须走两阶段

当视频时长从几十分钟拉长到数小时甚至数天,把它整体塞进多模态大模型(Multimodal Large Language Model,MLLM)做端到端处理已经不可行:上下文长度、显存占用与注意力计算量三重约束同时收紧,再强的模型也只能靠采样丢帧,而丢帧恰恰可能丢掉答案所在的那一秒。

于是行业普遍转向两阶段范式:第一阶段做与查询无关的记忆构建(query-agnostic memory construction),把长视频压缩成可检索的记忆;第二阶段在提问到来时做检索式推理。这个范式内部还有一个关键分叉——记忆构建究竟该优化「语义完备」还是「召回充分」。

记忆该建成什么样:先保证召回

MERIT 的作者选择的是后者。他们的判断很直接:既然构建阶段看不到下游问题,那么任何针对特定高层关系做的预建模都是一次押注,押错就白花算力。与其猜问题,不如把记忆的可检索性做到尽可能高,等真正提问时再去组合关系。这个取舍看起来朴素,却是整套设计的地基。

MERIT 的两个核心机制

情节式多键表示

第一个机制是情节式多键表示(episodic multi-key representation)。它不把一段视频压成单一向量,而是为每个记忆单元配上多把「钥匙」,覆盖时间位置、实体、动作等不同侧面。检索时只需做简单的键匹配(key-matching),就能定位到足够细粒度的记忆片段,而不必维护复杂的图结构或分层摘要树。

邻域过滤与推理时时间扩展

第二个机制解决「片段太短、上下文不够」的问题。语义在视频里是连续分布的:模型找到「杯子被拿起」的那一帧,答案往往藏在它前后若干秒的因果铺垫里。MERIT 的做法是邻域过滤(neighbor filtering)——只在被检索命中的片段周围按需扩展时间范围(inference-time temporal expansion),用局部邻域换到更宽的语义上下文,而不必为全局记忆构建付出巨额计算开销。

三条技术路线的取舍对比

路线 记忆构建代价 检索粒度 主要问题
端到端全量处理 无预处理,推理时全量计算 整段视频 时长超过阈值即不可行
复杂记忆预建模 高,需提前构造高层关系 粗粒度摘要 构建时不知查询,关系可能押错
MERIT 多键 + 邻域扩展 低,只优化可检索性 细粒度片段 + 可调邻域 依赖键设计质量,极长程因果仍受限

三项基准的表现该怎么读

论文报告:MERIT 在 EgoLifeQA、LVBench 与 Video-MME(Long)三项长视频基准上达到领先(state-of-the-art)表现。

三个基准代表的使用场景并不重合。EgoLifeQA 偏向第一人称日常记录的长程追问,考验的是跨时段追踪;LVBench 侧重大长视频里的细节定位与跨片段推理;Video-MME 的 Long 子集则更接近通用的长视频理解评测。三者同时领先,说明「多键检索 + 按需扩展」不是为某一类题型特化出来的解法,而是可迁移的框架。

谁应该关心它

最直接的受益者是三类场景:安防与巡检录像回溯、可穿戴设备的个人影像记忆、教研录播的内容定位。它们的共同特征是「存得多、问得少、问题不可预知」——这恰好是 MERIT 假设成立的地方。

边界在哪里

也要提醒自己:把关系组合推迟到推理时并不等于免费。邻域扩展的范围一旦设大,开销会迅速回到接近全局构建的级别;而如果答案依赖跨越极长时间的因果链,仅靠命中片段的局部邻域仍可能漏掉关键证据。论文没有给出这些参数在不同时长下的完整敏感度曲线,落地时仍需自行压测。

FAQ:关于 MERIT 长视频检索你最可能关心的 3 个问题

MERIT 和「切片 + 向量检索」有什么本质区别?

区别在于键的数量与扩展时机。普通切片检索通常一个片段只有一个向量,匹配粒度粗;MERIT 为同一记忆单元配多把键,从时间、实体、动作等多个侧面命中,命中后再按需求扩展时间邻域,把「找得准」和「看得够」拆成两个可分别调节的步骤。

邻域扩展会不会把无关噪声一起带进来?

会,这正是需要调参的地方。设计上用邻域过滤来约束扩展范围,只在命中片段周围按需扩张,而非全局扫描;但窗口越大,噪声越多、开销也越高。建议从较小的邻域起步,按任务命中率逐步放宽。

它能不能直接用在自己的业务长视频上?

框架本身与具体模型无关,落地门槛主要在记忆键的设计上:键要覆盖你业务里真正会被问到的维度,比如时间、人物、物体、动作。论文公开的是方法与基准结果,具体的键集需要按自有语料重新设计。

小结

MERIT 给出的不是一个更复杂的记忆结构,而是一次成本重心的转移:把「预理解」的钱省下来,花在提问之后的精准定位与按需扩展上。对任何面对小时到天级视频、且无法预知问题的团队来说,这个思路比继续堆砌记忆复杂度更值得先试一遍。

消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://arxiv.org/abs/2608.07663

相关阅读

这条线上还有几篇站内文章可以接着看: