EgoMonth:首个跨月第一人称长视频基准,最强模型落后人类22.4%
EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

在过去一年的多模态大模型(MLLM)演进中,长上下文与视频理解似乎迎来了指数级增长。从支持数万 Token 到数百万 Token,从几分钟的短视频切片扩展到数小时的长电影分析,各大模型在主流视频基准上的表现频频刷新纪录。然而,这种繁荣背后隐藏着一个被长期忽视的系统性偏差:现有的长视频评测几乎全部建立在网络切片、影视剧片段或互不相关的独立单次会话(Isolated Sessions)之上。在这些数据集中,场景频繁切换,镜头之间缺乏物理世界中的持久环境约束,更没有任何跨越数日乃至数周的时空连续性。
ArXiv URL:https://arxiv.org/abs/2608.13113v1
现实物理生活中的第一人称(Egocentric)体验有着截然不同的底层逻辑。真实的日常生活是高度冗余却又在时间上极其不均匀的:一个人可能会在熟悉的房间、工位与通勤路线上重复无数次单调的动作,但真正决定关键事件差异的转折点往往极其稀疏,甚至相隔数天或数周。与此同时,身处的物理环境并非一成不变,而是随着日常活动发生细微演变。理解这种跨越数周乃至数月的第一人称视频,本质上不再是一个单纯的“密集单帧感知”任务,而是一个极其考验“长期时空记忆”的认知难题。
针对这一核心空白,来自华为、南京大学与天津大学的研究团队推出了首个跨月级第一人称视频理解基准——EgoMonth。该基准汇集了 20 位志愿者在 20 至 120 天真实生活跨度内采集的超过 300 小时第一人称连续视频,并在此基础上构建了 1,443 个经过三轮交叉审核的人工问答对。通过横跨 14 个任务、三层认知深度的评测体系,这项研究揭开了一个残酷的现实:即便是当前最顶级的专有模型 Gemini 2.5 Pro,其宏平均准确率也仅有 71.8%,相较于人类基准的 94.2% 存在高达 22.4 个百分点的断层差距;在跨视角空间推理、路线推理等任务上,多个开源大模型甚至跌落至接近或低于 25% 的随机盲猜水平。

从单次切片到跨月连续:长视频评测的范式转移
要理解 EgoMonth 的特殊性,首先需要审视现有长视频基准的局限。从早期的 MMBench、MVBench 等秒级或分钟级短视频评测,到后来的 Video-MME、LongVideoBench、MLVU 以及 HourVideo,测试时长虽然成功被推向了数十分钟乃至数小时,但它们绝大多数依赖网络下载的影视解说、纪录片或录播会议。这些视频存在两个致命的人工痕迹:一是镜头剪辑带来的场景跳跃,缺乏连续的物理因果;二是任务边界封闭在单次播放窗口内,无法模拟智能体在同一真实环境中长期生存、反复交互的记忆过程。
即便是在第一人称具身感知领域久负盛名的 Ego4D 与 Ego-Exo4D,其数据采集也大多侧重于特定活动或特定场景的单次连续录制,极少针对同一位主体进行跨越数月、追踪行为与环境演变的长期观察。这导致当前的视频大模型在测试集上看似无所不能,一旦置身于真实的日常生活流中,面对“上周二我把备用钥匙放在了哪里”或“这一个月内我常去的超市货架陈列发生了什么变化”这类问题时,往往瞬间失灵。
真实世界的第一人称长视频要求模型具备从高冗余流中沉淀稳定认知图式(Schema)、在海量时间轴中精确定位稀疏情景(Episodic Indexing),以及将相隔多天的独立碎片串联为因果链路(Cascading Reasoning)的综合能力。正是在这种认知需求下,EgoMonth 彻底打破了单视频评测的传统假定,不仅涵盖单视频内的深层推理,更首次将“跨视频、跨日期联合推理”置于基准的核心位置。
真实、隐私合规与多级认知框架构建
构建一个跨越数月的真实第一人称视频基准,工程难度与隐私合规要求极高。研究团队最初招募了 30 名志愿者,录制了超过 400 小时的原始生活流。为了避免模型对单一录制硬件或特定视角产生偏见,采集设备涵盖了智能手机、运动相机等多种穿戴形式,覆盖了起居、通勤、办公、社交与户外等多维场景。
在数据清洗阶段,研究团队制定了严苛的筛选流程,直接剔除了长时间静止、低头看地、动作单调或过度破碎的无效片段,最终保留了 20 位参与者、时间跨度在 20 到 120 天之间的 738 条高质量片段,总时长超过 300 小时,所有视频均保持在 1K 以上分辨率与 25 fps 以上帧率。

由于第一人称穿戴设备会高频捕捉到路人面部、车牌、家庭住址乃至手机电脑屏幕等高度敏感信息,团队研发了一套自动化结合人工复审的脱敏管线。首先利用 Grounding DINO 1.5 对可能涉及隐私的区域进行开集检测,随后接入 SAM 2 进行逐帧高精度实例分割,并施加强高斯模糊或掩码遮蔽。所有脱敏后的视频片段再经由人工逐帧巡检,未通过合规标准的片段直接被剔除。这一流程在彻底阻断隐私泄露风险的同时,最大程度保留了第一人称视角中的关键时空线索。
基于这些长周期数据,EgoMonth 提出了一个受到认知心理学与工作记忆理论启发的 14 任务评估体系,将其清晰地划分为由浅入深的三个认知层级:
-
图式巩固(Schema Consolidation):评估模型从长时间高度冗余的生活记录中提取稳定行为模式与统计规律的能力。例如“行为频率统计(Action Frequency)”与“习惯识别(Habit Identification)”。这类任务并不依赖精准抓取某一个孤立瞬间,而是考察模型能否在大规模重复中过滤噪声,形成宏观认知抽象。
-
情景索引(Episodic Indexing):转向稀疏性挑战,要求模型在长达数小时或数天的视频流中精准定位特定的瞬时状态。包括“细节检索(Detail Retrieval)”、“事件发生时间定位(Event Time)”、“时序先后排序(Temporal Ordering)”以及“物品位置追踪(Object Location)”。在这一层级,任何细微的时序错乱或视觉误认都会直接导致索引失败。
-
级联推理(Cascading Reasoning):认知负荷最高的综合层级。模型不仅需要检索出多段跨越不同时间、地点与视角的记忆片段,还必须在工作记忆中对其进行联合逻辑推导。具体涵盖“自身定位(Self-localization)”、“路线推理(Route Reasoning)”、“跨视角空间推理(Cross-view Spatial Reasoning)”、“方向判断(Direction Judgement)”、“事件计数(Event Counting)”、“物品计数(Object Counting)”、“程序规划(Procedure Planning)”以及“因果推断(Causal Reasoning)”。在级联推理中,任何一个前置节点的索引漂移或空间关系误判,都会如多米诺骨牌般引发全链路的推理崩溃。


基准内包含的 1,443 个四选一单选问答全部由人工基于视频事实精心设计,坚决杜绝了模板化生成与纯语言大模型自动生成的虚假问答。更重要的是,其中有大量问题必须同时调阅相隔数天的多段独立视频才能得出唯一解。例如,一道典型的跨视频问题可能会问:“根据参与者在第 5 天和第 18 天的两次路线记录,他在哪一次通勤途中绕过了施工区域?”这直接斩断了模型试图靠单段上下文“走捷径”的可能。
顶尖多模态模型的集体滑铁卢:从评测中看到的残酷现实
为了全面摸清当前大模型的技术底牌,研究团队选取了涵盖开源与闭源体系的 12 个代表性模型进行严格的统一标准化评测,包括 Gemini 2.5 Pro(输入设为 1 fps)、Qwen2.5-VL(32B)、Qwen3-VL(8B 及 30B 变体)、MiniCPM-V 4.5、VideoLLaMA3、ST-LLM 等。作为客观参考系,三位从未参与过出题的独立标注员完整观看了对应视频并作答,测得人类基准的宏平均准确率为 94.2%(微平均准确率 95.1%,标注者间一致性系数 Fleiss’ $\kappa = 0.78$)。
实验数据暴露出极其鲜明的断层现象:
第一,认知复杂度上升直接导致模型性能断崖式下跌。所有参测模型在第一层“图式巩固”任务中均取得了相对较高的得分,但在进入第二层“情景索引”特别是第三层“级联推理”时,准确率普遍出现崩塌式下滑。作为全场表现最优的闭源模型,Gemini 2.5 Pro 跑出了 71.8% 的宏平均成绩,但与人类基准相比依然存在 22.4 个百分点的巨大鸿沟。而在开源阵营中,表现最好的 Qwen2.5-VL(32B)宏平均准确率仅为 58.0%,与人类的差距扩大到了 36.2 个百分点。
第二,空间与时序推理出现“盲猜化”崩溃。在涉及三维空间几何与第一人称动态位移的任务中,开源模型的表现尤为触目惊心。在“路线推理(Route Reasoning)”、“跨视角空间推理(Cross-view Spatial Reasoning)”以及“方向判断(Direction Judgement)”等几项关键任务中,多个模型的准确率甚至长期徘徊在 25% 的随机概率附近,甚至有模型直接跌破 25%。这意味着,即便模型已经把数百帧画面送入了 Transformer 上下文,其在三维物理世界中的空间拓扑与朝向感知能力基本处于完全失准的状态。
第三,小模型局部亮点与大模型全局优势并存,但无一具备忠实记忆。尽管大参数模型通常在需要维持多步推理状态的任务中表现更好(例如 Qwen2.5-VL 32B 在规划任务中取得了 78.6% 的不错成绩),但参数规模并不绝对等同于记忆检索精度。仅有 8B 参数的 MiniCPM-V 4.5 在第二层“细节检索”(66.5%)和“时序排序”(70.1%)等精细化定位任务上,反而击败了部分参数规模更大的对手。这表明,浅层感知特征的高保真保留与深层语义的多步抽象,在现有架构中依然处于某种撕裂状态。
为什么单纯堆砌帧数和参数量无法拯救长期记忆?
面对 EgoMonth 的极端挑战,许多从业者首先想到的解决方案或许是:既然视频时间跨度长,那我们进一步提升上下文长度,从 256 帧堆叠到 1024 帧甚至上万帧,或者把模型参数从 7B 扩展到 70B,问题不就迎刃而解了吗?
评测结果给出了极其明确的否定回答。论文深入拆解了评测背后的失败案例,指出了单纯依靠“帧数暴力堆叠”和“参数平铺直叙”所遭遇的技术死局:
1. 密集帧输入的“注意力稀释”与“对应关系雪崩”
在评测中出现了一个反常识的现象:轻量级模型 VITA-1.5 仅仅输入了 16 帧,在“事件计数”任务上却拿下了 41.6% 的准确率,反而大幅超越了接收 256 帧输入的 Qwen2-VL 7B(36.8%)。这一现象深刻揭示了长视频处理中的“注意力稀释(Temporal Attention Dilution)”效应。
在长达数月的日常第一人称视频中,绝大多数画面是视觉高度相似的背景走廊、桌面或固定机位。当未经筛选的大量冗余帧被强行转化为大量视觉 Token 塞入自注意力层时,原本决定问题答案的关键帧特征被淹没在海量的背景噪声中。模型不仅没有因为看到更多细节而变聪明,反而在注意力计算中失去了焦点。
更严重的问题在于“跨帧对应关系模型化(Cross-frame Correspondence)”的脆弱性。当采样密度增高时,同一个水杯、同一扇门或同一场交谈会在数十个连续或非连续的片段中反复闪现。现有的多模态架构极其容易混淆“同一物体在不同时间的状态演变”与“不同空间中相似物体的独立存在”。许多模型在面对计数任务时,要么把同一个被反复注视的物体误判为多个不同实例,要么把相隔数天发生的两次同类事件合并为一次,导致基础事件计数的系统性崩塌。
2. 参数规模无法代替精准的“索引机制”
参数扩展(Scaling)确实让大模型在长程因果推演与规划上展现了更强的容错空间,但参数本身无法解决“找错证据”的根本缺陷。
许多情景检索任务要求模型从数百小时的记忆库中精确抓取某一个特定时刻的状态转变(例如“作者是在哪一天把工牌换成了新挂绳”)。如果多模态注意力检索出的仅仅是一个视觉特征相似、但实际发生在错误日期的历史片段,那么后续模型的逻辑推导能力越强,它基于错误证据输出“极其自信却错得离谱”的幻觉概率就越高。换言之,推理能力必须建立在精准的证据索引基础之上,参数量的单向膨胀无法天然赋予模型时空定位的确定性。
3. 缺乏显式的结构化时空表征
综合各项失败模式,论文指出了当前多模态大模型的底层致命伤:它们本质上只是一个“有损的宏观摘要器(Lossy Summarizer)”,而根本不是一个“忠实的物理记忆器(Faithful Memorizer)”。
在人类的大脑认知中,长期记忆依赖于清晰的拓扑映射与事件索引结构——海马体和内嗅皮层构建了基于认知地图(Cognitive Maps)的空间坐标系统,而情节记忆系统则以离散事件为单元打上时间戳并维系状态因果。反观现有的视频大模型,无一例外地将连续动态的时空流粗暴降维成扁平的 Token 序列。在这种完全依赖隐式自注意力维系的扁平表征中,模型既没有建立起关于房间、路线和地标的全局欧氏空间地图,也没有形成关于跨天事件状态变迁的显式持久账本。当问题需要多步跨视角转换或跨周因果推导时,隐式时空关系的断裂便不可避免,最终引发连锁崩溃。
走向真正的具身长期时空记忆
EgoMonth 的发布为整个视频理解与具身智能社区敲响了一记警钟:依靠在影视短片或静态网络视频上刷榜,并不能真正迈向能够融入人类真实生活的长期智能体。
无论是打造能够在数月跨度内协助人类打理日常琐事的个人专属 AI 助理,还是开发能够长期自主导航、环境理解的家庭服务机器人,缺乏跨天跨周的持久记忆机制都是目前不可逾越的鸿沟。
从架构设计的角度来看,EgoMonth 的诊断结果指明了下一代视频基础模型的可能进化方向:
第一,未来的多模态模型必须告别对原始密集帧的无脑自注意力堆砌,转而探索基于事件驱动的动态检索与稀疏记忆索引网络;
第二,系统需要引入显式的结构化时空解耦表征,例如在底层维持轻量化的全局 3D 拓扑地图与状态转移图谱,将“几何空间关系”与“语义演变关系”从模糊的语言 Token 关联中剥离出来;
第三,在长程复杂推理中引入显式的工作记忆管理与中间状态验证机制,阻断级联推理过程中的早期误差传导。
当我们在谈论通用人工智能(AGI)迈向物理世界时,真正的基石不仅仅在于模型能否“看完一部两小时的电影并总结大意”,更在于它能否在日复一日的真实物理流逝中,如同人类记忆一般,忠实地沉淀习惯、精确地打捞片刻,并在错综复杂的时空轨迹中始终锚定真相。EgoMonth 迈出的这一步,正在将长视频大模型的评测标准,真正拉回现实世界的严酷尺度之下。