这项由南京大学、上海人工智能实验室、上海交通大学、浙江大学、中国科学技术大学和复旦大学联合开展的研究,于2026年7月以技术报告形式发布,论文编号为arXiv:2607.17423v1,有兴趣深入了解的读者可以通过该编号查询完整论文。
你有没有遇到过这样的烦恼:明明记得那部纪录片里有一段特别精彩的画面,却要把整个视频从头拖到尾一帧一帧地找?或者问AI"视频里有没有出现猫",它能告诉你"有",却没法告诉你"在第3分27秒到第3分45秒"?这个看似细小的缺陷,其实是当今AI视频理解领域一个根本性的短板——AI能读懂视频里"发生了什么",却不太能精确告诉你"它发生在哪个时间段"。
南京大学的研究团队把这个能力称为"视频时间定位",并以此为核心,开发出了一套名为TimeLens2的系统。这套系统的核心雄心是:用一个统一的模型,在各种长短不一、内容各异的视频里,精准找到任何你感兴趣的时间段——无论那段内容只出现了一次,还是零零散散地出现了好几次,无论视频只有几十秒,还是长达一个多小时。
要理解这项研究的价值,可以把AI视频理解比作一个侦探。之前的AI侦探已经能看完一整个案件现场,然后告诉你"这里发生了一起谋杀案"。但如果你想知道"凶手的手套放在哪个抽屉里、从几点到几点被放在那里",它就束手无策了。TimeLens2要做的,就是培养出一批能精准指出"证据在第几分第几秒"的顶级侦探。
---
一、案件背景:为什么"找时间段"这么难?
在深入了解这套系统的具体工作方式之前,有必要先理解这个问题究竟难在哪里。
表面上看,"在视频里找到某个时间段"似乎是个简单任务。实际上,这里藏着三层相互交织的困难。
第一层困难来自标注数据本身的可靠性。研究团队把这个问题称为"标注质量问题"。当人类标注员面对一段一小时的视频,被要求找出"所有出现红色汽车的时间段"时,他们很容易犯以下几种错误:把不同时间出现的两辆相似红色汽车搞混、漏掉某次出现、把开始时间标早了几秒或结束时间标晚了几秒。视频越长,这些错误就越多。更麻烦的是,视频里大多数内容都是无关的"干扰项",真正相关的内容可能只占整个视频的一小部分。这就像让侦探在一个装满无关文件的巨大档案室里,仅凭记忆一次性找出所有关键证据。
第二层困难来自目标本身的形态。有些证据只出现一次,有些却断断续续出现好几次。比如"搅拌红色酱汁的所有片段",可能在视频的第2分钟、第8分钟、第15分钟都各有一段。传统的AI方法通常只会找出一个连续的时间段,没办法优雅地处理这种"多处出现、各自独立"的情况。
第三层困难来自训练AI的方式本身。即便有了高质量的标注数据,用什么标准来"打分"、指导AI改进,依然是个棘手问题。常用的打分标准叫做"时间重叠度"(tIoU),它衡量AI预测的时间段和正确答案有多大面积重叠。但这个指标有个致命缺陷:只要AI的预测和正确答案没有任何重叠,不管AI预测的位置是差了1秒还是差了10分钟,得分都是一样的零分。这就像评判一个侦探,只要他没找到凶器,不管他找的地方是离凶器藏匿处一步之遥还是相差十万八千里,都被认定为"完全失败"——这显然不公平,也无法给侦探任何有效的方向性指引。
这三层困难共同构成了TimeLens2需要解决的核心挑战。
---
二、建立案件档案库:93,000个高质量训练样本是怎么来的
任何侦探学校的核心资产都是案例库。TimeLens2的案例库叫做TimeLens2-93K,包含23,793段视频和93,232个标注好的"查询-时间段"对,其中还有12,091个包含多个不连续时间段的复杂案例。
为了让这个案例库足够多样,研究团队从YouTube收集了34,867段视频,涵盖娱乐、教育、体育、新闻、科技、游戏、旅行、汽车、音乐、日常生活等15个领域。更重要的是,这些视频在时长上经过了刻意的分层设计:一分钟以内的有10,000段,一到十分钟的有10,000段,十到三十分钟的有10,000段,三十到六十分钟的有3,096段,超过一小时的有1,771段。这样的分层确保了训练数据覆盖各种"搜索难度"——在30秒的视频里找目标和在一小时的视频里找目标,对AI来说是完全不同量级的挑战。
然而,仅仅收集视频还远远不够。关键在于,如何为每一段视频生成可靠的标注。研究团队设计了一条六步流水线,这条流水线的核心思想是:把"一次性做出全部判断"这个高风险动作,拆解成"一系列逐步聚焦、相互验证"的低风险决策。
第一步是给每段视频建立"分层时间索引"。团队使用一种叫做PySceneDetect的工具,根据视频内容的变化,把视频切分成20到60秒的小片段,然后用大型视觉语言模型(具体来说是Qwen3-VL-235B,一个极其强大的AI模型)为整段视频生成一个全局描述,同时为每个小片段生成一个局部描述。全局描述负责把握"这个视频整体在讲什么",局部描述则精确记录"这个片段里发生了什么具体动作或变化"。这就像侦探在研究案件时,既要有整个案件的概览,又要有每个现场细节的详细记录。
第二步是"自动生成查询和粗略候选区间"。研究团队用另一个强大的AI(Kimi-K2.5)读取所有这些描述,自动生成有意义的查询语句,同时初步圈定哪些时间段可能和这个查询相关。这些初步圈定的时间段叫做"粗略候选区间",它们继承了视频描述里的时间信息,为后续的精确定位提供了起点。值得注意的是,这些候选区间还不是最终答案——它们只是缩小了搜索范围。
第三步是"双侦探独立侦查"。这是整个流水线最有趣的环节。研究团队部署了两个完全独立的AI模型——Qwen3-VL-30B-A3B和TimeLens-8B——让它们各自独立地观看视频中的相关片段,并给出自己认为正确的时间段标注。这两个AI的"思维方式"不同(用专业术语说是"归纳偏置"不同),就像两个来自不同背景的侦探,他们会用不同的方式分析同一个案件。每个AI都可以给出一个或多个时间段,也可以给出"空集"(意味着它认为这个视频片段里根本没有相关内容)。
第四步是"双侦探协商取证"。两个AI给出各自的答案后,系统会计算两份答案的"时间重叠度"。如果重叠度超过0.9(也就是说两个AI的答案高度一致,相差不超过10%),这个案例才被认为是"可靠的",被保留下来,并以Qwen模型的答案作为标准答案。这个设计背后的逻辑是:如果两个思维方式不同的侦探得出了几乎相同的结论,这个结论很可能是正确的;如果两人意见分歧很大,说明这个案例本身存在歧义,不应该被用来训练AI。
仅仅时间上一致还不够,研究团队还在第四步中加入了"语义验证"。他们用另一个AI模型(Qwen3-VL-Embedding)把被保留的视频片段和对应的查询语句都转换成数学向量,然后计算两者的相似度。如果相似度低于0.5,意味着即便两个侦探找到了同一个地方,这个地方也和案件本身关系不大,这个案例同样会被排除。这道关卡筛掉了"两个AI碰巧都找错了同一个地方"的情况。
经过这两道关卡,原本百万级别的候选标注被大幅压缩——从最初的近百万条,经过时间共识筛选后剩下约17万条,再经过语义验证后剩下约9.3万条。规模是缩小了,但质量却大幅提升。
第五步是"边界精修"。经过前面的验证,研究团队已经确认了"哪些时间段是有效的",但时间段的精确起止点往往还不够准确。于是,他们对每个时间段的边界,各向前后延伸3秒,让强大的Qwen3-VL-235B模型仔细观察这6秒的"过渡区域",精确找出真正的开始点和结束点。对于那些相邻时间段之间只有不到1秒间隔的情况,系统会把它们合并,认为这种微小的间隔不过是眨眼之间的遮挡或者边界标注的小误差,而非真正独立的两段。
这套六步流水线的精妙之处在于,它把"一个人面对整个视频做出一次判断"变成了"多个独立系统在局部范围内做出相互验证的判断"。每一步都只处理自己擅长的子问题,每一步的错误都会被下一步的验证机制捕捉并修正。最终留下来的9.3万条标注,是经过层层筛选的高置信度证据。
---
三、训练侦探学校:如何让AI真正学会"时间搜索"
有了高质量的案例库,接下来是如何利用这些案例训练出出色的AI侦探。研究团队采用了两阶段的训练策略。
第一阶段是"通读案例,习得能力"。研究团队把Qwen3-VL系列基础模型(一种强大的视觉语言AI,分别有20亿、40亿、80亿参数三个版本,参数可以粗略理解为AI的"脑细胞数量")放在完整的长视频上进行训练,让它同时学习TimeLens2-93K的数据、已有的TimeLens-100K数据集,以及Ego4D-NLQ的第一人称视角视频数据。
这一阶段有一个重要的设计细节:格式多样化训练。同一个查询和同一段目标时间,会被用27种不同的提问方式和28种不同的回答格式来呈现。比如,同样是"找到搅拌酱汁的时间段",有时候会问"这个动作发生在什么时候?",有时候会问"请定位视频中搅拌酱汁的所有片段",有时候用JSON格式回答,有时候用自然语言回答,有时候用分秒格式,有时候用纯秒数格式……总计形成了756种不同的"问答界面组合"。
这种设计的目的是让AI学会的不是"如何回答某种特定格式的问题",而是"如何理解视频里的时间线索本身"。就像一个真正优秀的侦探,不管别人是用中文、英文还是手势比划来问他,他都能准确指出证据在哪里——因为他真正掌握的是案件本身,而不是如何应对特定的问句形式。
第一阶段的效果是让AI具备了"在长视频里搜索证据"的基本能力。但研究团队发现,仅凭这个训练,AI给出的时间段往往还不够精准——就像一个侦探已经能找到正确的房间,却还没精确到正确的抽屉。
于是进入第二阶段:用强化学习做精细校准。强化学习可以理解为"通过不断尝试和打分来改进"——AI猜一个答案,系统打个分,AI根据得分调整策略,再猜,再打分,如此循环。具体使用的技术叫GRPO,在这个过程中,系统会为每个问题生成多个候选答案,通过比较不同答案的得分来指导AI改进。
为了让强化学习更有效率,研究团队还引入了"难样本优先"策略:在进入强化学习训练之前,先用第一阶段训练好的模型,对训练数据里的每个问题跑8次测试,看看平均得分。得分越低的问题,说明AI在这类问题上越薄弱,在后续训练中就给予越高的权重。这就像一个侦探学校,不把时间平均花在所有案例上,而是重点针对学员最容易出错的案件类型进行专项训练。
---
四、发明新的打分标准:用"搬运距离"来衡量预测质量
这套训练系统的另一个核心创新是打分方式的设计。前面提到,传统的时间重叠度(tIoU)打分有个根本缺陷:只要没有重叠,不管差多远都得零分。研究团队为此专门设计了一种新的打分方式,叫做"时间Wasserstein奖励"(RTW)。
要理解这个打分方式的直觉,可以用沙堆搬运来类比。假设正确答案是"把沙堆放在某个位置",AI给出的答案是"把沙堆放在另一个位置"。时间Wasserstein奖励衡量的是:把AI放置的沙堆搬运到正确位置,需要搬运多远的距离?距离越短,说明AI的答案越接近正确,得分越高;距离越远,说明AI的答案偏差越大,得分越低。
这个"搬运距离"的计算方式有一个巧妙之处:它不管AI把沙堆分成了几堆(也就是不管AI给出了几个时间段),只关心所有沙堆合在一起后,整体的"重心"和"覆盖范围"与正确答案有多接近。这解决了一个传统方法会遇到的棘手问题:当AI把一个时间段拆成两段预测时,传统的"一对一匹配"打分方式就会出问题,但Wasserstein距离完全不受这种"分法不同"的影响。
用一个具体例子来说:正确答案是"第3到第7秒",AI-A预测的是"第8到第12秒"(差了1秒才挨上),AI-B预测的是"第50到第55秒"(差了43秒)。传统的tIoU会给两个AI都打0分,因为都没有重叠。但Wasserstein距离会告诉系统:AI-A只需要把沙堆搬动1秒的位移就能到达正确位置,而AI-B需要搬动43秒的位移——AI-A明显更接近正确答案,应该得到更高的分数和更积极的鼓励。
实际的打分公式由三部分组成。第一部分是时间重叠度(RtIoU),衡量"已经猜中了多少";第二部分是时间Wasserstein奖励(RTW),衡量"没猜中的部分离正确答案有多远";第三部分是一个惩罚项(–1invalid),如果AI给出的答案完全不是有效的时间段格式(比如说了废话或者给出了非法数值),直接扣分。三部分相加就是最终分数。
研究团队还进行了一项值得关注的对比实验:他们测试了表示时间段的四种不同"沙堆形态"——用区间内所有时刻均匀分布来表示(均匀支撑)、只用起止两个端点来表示(端点原子)、用钟形曲线从中心向两侧扩展来表示(中心高斯)、以及在边界处放置钟形曲线来表示(边界高斯)。实验结果表明,均匀支撑的效果最为稳定——因为它完整保留了时间段的"在哪里"和"有多长"两个信息,与最终评估指标的数学性质高度吻合,而其他三种方式都只保留了部分信息,容易在某些测试任务上表现好、另一些任务上表现差。
---
五、实战测试:七个不同类型的"侦查场景"
为了全面检验TimeLens2的实战能力,研究团队在七个不同类型的基准测试上进行了评估,每个测试代表一种不同的"侦查场景"。
第一个场景是短视频室内动作定位,对应的测试集叫Charades-STA的TimeLens重标注版本。这类视频通常只有几十秒到几分钟,查询的是具体的室内动作,比如"一个人打开了门"。
第二个场景是事件级别定位,对应ActivityNet Captions的TimeLens重标注版本。这类测试关注的是比单个动作更宏观的事件,比如"一场大浪打到了冲浪者身上并造成了冲击"。
第三个场景是精彩时刻与亮点检测,对应QVHighlights的TimeLens重标注版本。这类测试不仅要找到时间段,还要识别视频中"最精彩的部分",查询可能是"两个女性一起骑水上摩托艇"。
第四个场景是长视频多段定位,对应VUE-TR测试集。这里的视频更长,而且同一个查询对应的时间段可能分散在视频的多个不连续位置,比如"找到所有搅拌红色浓酱的时刻"。
第五个场景是长视频用户风格定位,对应VUE-TR-V2测试集。这类查询带有更主观的色彩,比如"给我看所有航拍镜头"——这要求AI不仅理解查询的字面意思,还要理解"航拍镜头"这个风格概念对应的视觉特征。
第六个场景是问句式定位,对应MomentSeeker测试集的纯文本查询子集。这类查询不是描述性的,而是疑问句,比如"从上到下,出现在比赛出发名单上的第一个名字是什么?"——AI不仅要理解问题,还要定位到能回答这个问题的视频片段(可能是一个出现文字的短暂画面)。
第七个场景是第一人称视角自中心定位,对应Ego4D-NLQ的官方验证集。这类视频是从佩戴摄像头的人的视角拍摄的,查询同样是疑问句,比如"我把洋葱放在哪里了?"——这要求AI理解第一人称叙事并在日常生活记录中搜索。
这七个场景从短到长、从简单到复杂、从客观描述到主观风格、从第三人称到第一人称,覆盖了视频时间定位任务可能遇到的大多数实际情境。
---
六、比赛结果:小型AI侦探团队完胜千倍规模的对手
实验结果相当显眼。
以20亿参数的TimeLens2-2B为例,它在七个测试的平均时间重叠度(mIoU,可以理解为"平均精准度")上达到了44.5分,比同等规模的其他模型都要高——比参数量相同的Qwen3-VL-2B高出了14.2分,甚至比参数量是它4倍的TimeLens-8B还高2.4分。
40亿参数的TimeLens2-4B表现更加惊人:它在六个测试上击败了所有对手,包括那些参数规模是它一百倍的闭源大模型。具体来说,它比拥有3970亿参数的Qwen3.5-397B-A17B平均高出7.5分。这意味着一个"小"了将近100倍的系统,在这个任务上的表现超过了那个"大"系统。
针对不同类型的挑战,性能提升的幅度也不尽相同。与Qwen3-VL-4B基础模型相比,TimeLens2-4B在VUE-TR(长视频多段定位)上提升了19.6分,在VUE-TR-V2(用户风格定位)上提升了27.8分,在MomentSeeker(问句式定位)上提升了12.6分,在Ego4D-NLQ(第一人称定位)上提升了7.2分。这些大幅提升集中出现在最具挑战性的场景上,表明TimeLens2学到的是真正的"时间搜索"能力,而非单纯的数据拟合。
特别值得关注的一个发现是:TimeLens2-93K的训练数据都是陈述句式的查询,里面完全没有问句。但在MomentSeeker(一个全部用问句提问的测试集)上,用TimeLens2-93K训练出来的模型,成绩从基础模型的15.3分跳升到了25.8分。这说明AI学到的不是"如何应对陈述句式的查询",而是"如何在视频里寻找证据"这个更深层的能力,这种能力自然地迁移到了问句式查询上。
研究团队还提供了几个直观的对比案例。在一段93.7分钟的长视频里,当查询是"一个穿背心的男人坐在窗边的花盆旁,手里拿着一支笔"时,TimeLens2-4B精准找到了在视频第4750秒附近的那一小段,而对比模型要么给出了无效的时间戳,要么找到了视频前半段某个相似但错误的位置,要么在正确位置附近但偏差明显。在另一个多段定位案例里,查询是"手铐",正确答案是视频里五个分散的时间窗口,TimeLens2完整找到了全部五个,而其他模型要么漏掉了一些,要么加入了错误的时间段。
---
七、解剖实验:每个设计选择都有多重要?
除了总体性能比较,研究团队还进行了大量的"拆零件"实验,验证每个设计选择对最终效果的贡献。这些实验的结论可以帮助我们理解哪些因素最为关键。
关于训练数据规模,研究团队发现,数据量和性能之间存在一个"边际递减"的规律。仅用5%的TimeLens2-93K(约4,700条样本)进行训练,性能就从基础模型的34.7分跳升到了42.8分;用到20%时达到45.3分;用全量数据达到45.8分。前5%的数据带来了最大的提升,后面的数据虽然提升幅度越来越小,但在最难的长视频和第一人称场景上仍有持续改善。
关于标注质量的每一个流水线步骤,研究团队发现了一个清晰的"层层递进"效果。如果直接用Qwen3-VL-30B-A3B的原始标注(未经任何验证)训练,得到42.0分;加入双侦探时间共识验证后,用的数据量从73.5万条降到了17.4万条,但得分反而升到了43.4分;再加入语义验证后,数据量进一步降到9.3万条,得分升到44.1分;最后加上边界精修,得分升到45.8分。这说明数据质量的作用远大于数据数量,精准但少量的标注胜过粗糙但海量的标注。
关于训练时的最大序列长度,研究团队发现,把AI一次能看到的视频信息量从16K个"词元"增加到100K个"词元",平均得分从44.4分提升到46.4分。不同类型的任务从这种长上下文训练中受益的程度不同:Charades这类短视频任务在32K时就基本饱和了,但VUE-TR-V2、MomentSeeker和Ego4D-NLQ这类长视频或复杂任务则一直到100K都还在持续改善。这说明长上下文训练的核心价值在于扩展AI的"搜索地平线",让它能在更长的时间线上保持有效的搜索能力。
关于指令和回答格式的多样化,2×2对比实验(单一查询格式 vs 多样化查询格式,单一回答格式 vs 多样化回答格式)表明,两种多样化的效果相互叠加,共同多样化比单独使用任何一种都更好,平均提升了0.9分,其中在VUE-TR上的提升高达3.0分。
关于Wasserstein奖励的贡献,研究团队发现,它把平均得分从47.0分提升到47.7分,关键在于它"拯救了"那些传统打分给出零分的预测组。在强化学习的每次迭代中,系统会为同一个问题生成一批答案,然后通过比较它们的得分来指导AI改进。如果所有答案都和正确答案没有重叠,传统tIoU给所有答案都打0分,平均之后得到的训练信号是一片空白。研究团队统计发现,在300个训练步骤里,传统tIoU有13.8%的"问题组"是这种"全部答案都是零分"的情况——这些问题组对AI的训练毫无帮助。而加入Wasserstein奖励后,这个比例从13.8%降到了3.6%,其中75.8%原本全是零分的问题组,现在都有了有意义的得分差异,能够有效指导AI改进。
---
说到底,TimeLens2解决的问题看起来像是个"技术细节",但实际上触及了一个很根本的问题:AI什么时候才算真正"理解"了一段视频?仅仅能描述内容显然不够,能精准定位证据才算真懂。
这项研究最让人印象深刻的地方,不是某一个单点技术突破,而是它把整个问题链条从数据质量、训练方式到评估指标都重新审视了一遍,并且在每个环节都找到了更合理的解决方案——数据层面用多侦探协商代替单人判断,训练层面用多样格式代替单一模板,优化层面用搬运距离代替零一判定。这种系统性的思维方式,或许比任何单项技术创新都更有参考价值。
对于普通用户来说,这项研究意味着未来的视频助手将更有能力回答"这件事发生在视频的什么时候",无论是在监控录像里查找事故时刻、在教学视频里快速定位关键步骤、还是在长篇纪录片里搜索某个特定场景。至于这种能力什么时候能普及到日常工具里,就要看工业界把这类研究成果落地的速度了。
有兴趣深入探究技术细节的读者,可以通过arXiv编号2607.17423v1查阅完整论文。
---
Q&A
Q1:TimeLens2是什么,和普通的视频AI有什么区别?
A:TimeLens2是南京大学等机构联合开发的视频时间定位模型。普通视频AI只能告诉你视频里"发生了什么",而TimeLens2能精准告诉你某件事"发生在视频的哪个时间段",并且支持同一件事在视频里多次出现的情况,能把所有出现的时间段都找出来。
Q2:TimeLens2-93K数据集是怎么保证标注质量的?
A:TimeLens2-93K用了一套六步验证流水线:先从视频描述中自动生成查询和候选时间区间,再让两个不同的AI模型独立标注,只有当两个AI的答案高度吻合(重叠度超过90%)且视频内容与查询语义匹配时,这条标注才被保留,最后还对保留下来的时间段边界做精细微调。
Q3:时间Wasserstein奖励解决了传统时间重叠度打分的什么问题?
A:传统的时间重叠度(tIoU)只要AI预测的时间段和正确答案没有任何重叠,不管差多远都给零分,无法区分"差一点点"和"差很远"的预测。时间Wasserstein奖励通过计算"把预测位置搬运到正确位置需要多远的距离"来打分,差一点的预测能得到比差很远的预测更高的分数,从而给AI提供有方向性的改进信号。