V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language ModelsAuthors:Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe RiccardiDeep-Dive Summary:V-DyKnow: 针对视觉语言模型中时效性知识的动态基准摘要视觉语言模型VLMs通常在文档、图像和文本的静态数据快照上进行训练。其训练数据和评估基准往往隐含地将事实知识视为不随时间变化的。然而现实世界的事实本质上具有时效性且会发生不规则或周期性的变化导致模型的预测变得过时。本文提出了V-DyKnow这是一个用于评估 VLMs 中时效性事实知识的视觉动态知识基准。利用 V-DyKnow我们对开源和闭源 VLMs 进行了基准测试并分析了( a ) (a)(a)模型响应在不同模态和输入扰动下的可靠性正确性和一致性( b ) (b)(b)知识编辑和多模态检索增强生成RAG方法在跨模态知识更新中的有效性( c ) (c)(c)通过数据和机制分析探究过时预测的来源。结果显示VLMs 经常输出过时的事实反映了其预训练阶段使用的旧数据快照。即使在实体被正确识别的情况下事实可靠性也会从文本刺激向视觉刺激退化。此外现有的对齐方法无法在不同模态间一致地更新模型知识。这些发现突显了当前 VLMs 在获取和更新跨模态时效性知识方面的根本局限性。1 引言视觉语言模型VLM越来越多地被用于根据视觉输入回答现实世界的事实问题。在这种场景下模型需要将图像内容与存储的世界知识联系起来。与大语言模型LLMs类似VLMs 是静态模型其事实知识是从不同时间点收集的大型异构数据快照中获取的。这些快照捕捉了世界及其实体的不同状态可能编码了同一事实的过时或冲突版本。图 1针对时效性事实知识进行多模态查询 VLMs 的示例。在视觉刺激下VLM 首先错误识别了实体并检索了错误事实。在澄清实体后模型生成了过时的答案。最后在文本中明确指出实体时才返回正确事实。该示例强调了本项目研究的关键问题VLMs 中过时知识的普遍性以及视觉与文本刺激之间的性能差距。现有的 VLM 知识评估主要使用具有固定地面真值ground truth的静态基准忽略了事实的动态演变。为了解决这一问题我们引入了V-DyKnow。该基准不再依赖固定标注而是根据评估时从Wikidata获取的最新事实信息来验证模型输出。V-DyKnow 将事实查询表示为视觉实体如肖像、国旗、Logo与关系和属性的配对每个实体都关联有时间有效区间。2 V-DyKnowV-DyKnow 旨在评估文本和视觉接地grounding下的时效性事实知识。事实表示采用主体 subject属性 property数值 attribute三元组。基准包含 139 个时效性事实涉及 47 个国家、28 名运动员和 22 个组织。视觉提示词构建配对查询对比主体实体以文本形式如“Apple 的 CEO 是谁”或视觉形式如提供 Apple 的 Logo 并问“这家公司的 CEO 是谁”出现时的表现。视觉表现包括国徽、国旗、人物肖像和公司 Logo。视觉实体识别为了区分错误是源于视觉识别失败还是事实知识缺失引入了辅助识别任务要求模型识别图片中的实体。评估协议响应被分为正确Correct当前有效、过时Outdated历史有效但当前失效和无关Irrelevant从未有效。策略采用上界策略Upper-Bound strategy对每个查询使用三个具有微小词汇扰动的提示词并取其中表现最好的结果。模型评估了包括 LLaVA-1.5、LLaVA-OneVision、PaliGemma 2、Molmo、Qwen2-VL、Qwen2.5-VL、InternVL3.5、GPT-4 和 GPT-5 在内的 9 种模型。表 1视觉和文本提示下最先进 VLMs 在 V-DyKnow 上的评估结果。结果显示了使用上界策略时的正确、过时和无关响应的百分比。(年份) 模型VLM 视觉提示VLM 文本提示LLM* 文本提示正确过时无关正确过时无关正确过时无关(2023) LLaVA-1.513%31%56%33%49%18%33%47%19%(2024) LLaVA-OneVision22%36%42%31%45%24%37%42%22%(2024) PaliGemma 23%4%93%0%0%100%62%28%10%(2024) Molmo24%20%56%34%44%22%40%40%20%(2024) Qwen2-VL28%38%34%36%44%20%37%42%22%(2025) Qwen2.5-VL32%38%30%39%40%22%44%35%21%(2025) InternVL3.526%21%53%40%29%31%51%29%19%(2025) GPT-471%18%11%72%19%9%---(2025) GPT-575%15%10%76%14%9%---3 结果分析A. 模型评估过时事实响应非常普遍往往超过正确答案。大多数模型在文本查询下的表现优于视觉查询。这种差距在 LLaVA-1.5 和 InternVL3.5 等模型中尤为明显表明视觉识别与事实召回之间的交互存在局限。有趣的是将 VLMs 与其基础 LLM 比较发现多模态训练往往会降低事实召回率PaliGemma 2 是典型例子。B. 输出一致性模型对文本提示的一致性Prompt Agreement通常高于视觉提示。GPT-4/5 在两种模态下均表现出较高的稳定性而其他模型对提示语形式非常敏感。表 3视觉和文本输入在三种不同词汇化提示下的一致性Prompt Agreement。(年份) 模型提示语一致性视觉文本(2023) LLaVA-1.552%70%(2024) LLaVA-OneVision66%80%(2024) PaliGemma 225%100%(2024) Molmo57%81%(2024) Qwen2-VL46%79%(2025) Qwen2.5-VL70%78%(2025) InternVL3.558%75%(2025) GPT-492%97%(2025) GPT-584%90%C. 更新 VLM 知识在知识编辑方法中只有 IKE 表现较好而 WISE 和 GRACE 效果不佳正确率低于6 % 6\%6%。检索增强生成RAG在两种模型上均表现出较好的一致性但其表现受检索质量限制且模型的参数化知识有时会干扰外部证据导致幻觉或持续输出过时信息。表 5对知识编辑和基于检索的对齐方法进行的定性错误分析。模型正确错误过时泛化回答幻觉LLaVA-1.5WISE3%73%0%24%GRACE21%63%1%15%IKE95%0%5%0%RAG检索文档74%2%0%23%黄金文档85%3%0%12%Qwen2-VLWISE4%34%3%57%GRACE34%51%0%14%IKE100%0%0%0%RAG检索文档80%5%0%15%黄金文档93%3%0%4%4 深入分析A. 数据区间估算通过 Wikidata 的有效区间分析我们发现尽管模型发布于 2023 年后但大多数预测对应的知识有效期在 2020 年之前表明训练数据主要反映了较早的世界状态。图 2基于 Wikidata 的模型响应时间分布。通过聚合正确和过时响应的有效区间可以近似估算模型参数中编码的世界状态。B. 响应与训练数据的关联对 Molmo 的预训练语料Wikipedia 部分分析显示若正确信息在训练快照的规范源中缺失模型则无法获取最新事实。C. 机制可解释性层级探针分析显示预训练模型通常只在最后一层分配高概率给候选属性。在成功的编辑中WISE 仅修改最后一层而 GRACE 影响了更广泛的中间层20-28 层。图 3Qwen2-VL 的机制分析展示了编辑方法如何改变跨层级的事实预测概率。5 6 讨论与结论分析表明过时知识在开源和闭源 VLMs 中都很常见。现有的训练范式依赖于静态快照且对齐方法不足以维持一致且最新的知识。解决这些挑战可能需要能够显式建模时间有效性、整合动态知识源并支持持续更新的新学习范式。V-DyKnow 为研究这些问题提供了重要资源。局限性V-DyKnow 的 139 个事实涉及高频实体因此结果应被视为性能上界。此外本工作未评估知识编辑可能带来的侧面负面影响。出于资源限制仅评估了 7B 规模的开源模型。Original Abstract:Vision-Language Models (VLMs) are trained on data snapshots of documents, including images and texts. Their training data and evaluation benchmarks are typically static, implicitly treating factual knowledge as time-invariant. However, real-world facts are intrinsically time-sensitive and subject to erratic and periodic changes, causing model predictions to become outdated. We present V-DyKnow, a Visual Dynamic Knowledge benchmark for evaluating time-sensitive factual knowledge in VLMs. Using V-DyKnow, we benchmark closed- and open-source VLMs and analyze a) the reliability (correctness and consistency) of model responses across modalities and input perturbations; b) the efficacy of knowledge editing and multi-modal RAG methods for knowledge updates across modalities; and c) the sources of outdated predictions, through data and mechanistic analysis. Our results show that VLMs frequently output outdated facts, reflecting outdated snapshots used in the (pre-)training phase. Factual reliability degrades from textual to visual stimuli, even when entities are correctly recognized. Besides, existing alignment approaches fail to consistently update the models’ knowledge across modalities. Together, these findings highlight fundamental limitations in how current VLMs acquire and update time-sensitive knowledge across modalities. We release the benchmark, code, and evaluation data.PDF Link:2603.16581v1部分平台可能图片显示异常请以我的博客内容为准