9月30日热播30部、将播6部剧推荐 一笑随歌定档 沉默的荣耀开播!... 加速资产处置,王健林何时度过危机?... 闻泰科技: 控股子公司管理办法(2025年5月修订)内容摘要... 206期姜山排列三预测奖号:通杀一码推荐... 工业和信息化部发文提升通信建设工程质量...
万达娱乐账号注册

热点资讯
新闻动态

你的位置:万达娱乐账号注册 > 新闻动态 > 清华大学研究出一套"智能剪辑师",让AI既能答题又能完成复杂任务

清华大学研究出一套"智能剪辑师",让AI既能答题又能完成复杂任务

发布日期:2026-07-18 06:33    点击次数:67

这项由清华大学领导的研究以预印本形式发布于2026年6月,编号为arXiv:2606.29445,有兴趣深入了解的读者可以通过该编号查询完整论文。

当你想学一道新菜,最自然的做法是找一个视频教程来看。你会一边看厨师的操作,一边在脑子里记下每个关键步骤:先热锅,再放油,葱姜爆香,接着下主料。看完视频,你能把这些步骤迁移到自家的厨房里,即使灶台的型号不同、锅的大小有别,你依然能做出差不多的效果。这种"看了就能做"的能力,对人类来说稀松平常,但对人工智能来说,却是一道至今仍未完全跨越的门槛。

清华大学的研究团队正是盯准了这个问题。他们发现,目前市面上的AI视频理解能力测试,大多只考察模型能不能"看懂"视频里发生了什么——比如"视频里有几只猫""那个人在做什么"。这就好比只考厨师"能不能读懂菜谱上的字",而不考"能不能真正做出菜来"。于是,这支团队做了两件事:一是设计了一套更难的考试,真正检验AI能不能把视频里学到的知识用到实际操作上;二是发明了一种更聪明的"剪辑方法",帮AI在茫茫视频中找到最关键的画面。

这两项成果分别叫做VG-GUI-Bench(视频引导图形界面基准测试)和TASKER(任务驱动且场景感知的关键帧搜索器)。前者是那道更难的考题,后者则是帮AI更好地完成这道考题的工具。

一、为什么现有的"视频理解考试"太简单了

每当一项新技术出现,研究者都需要一把"尺子"来衡量它到底做得有多好。对AI视频理解来说,这把尺子通常是"视频问答"测试——给AI看一段视频,然后问它问题,看它答得对不对。

问题在于,这类考题大多停留在"看图说话"的层次。AI只需要识别出视频里的物体、人物和简单动作,就能拿到不错的分数。这就像是期末考试只考填空题,完全不考"写一篇作文"或"解一道应用题"。一个只会死记硬背的学生,也许能在填空题上表现不错,但真正遇到需要理解、推理和运用知识的题目,就露馅了。

清华大学的研究团队把视频理解的难度分成了两个层次,并用"从感知到行动"这条线索贯穿始终。第一个层次是基础层,也就是传统的视频问答:AI需要找到视频中与问题相关的时间段,理解画面内容,再结合问题进行推理,给出答案。这一层考的是"看懂"。第二个层次则是进阶层,叫做"视频引导的智能体任务":AI不仅要看懂视频教程里的步骤,还要把这些步骤转化为实际的操作动作,在一个全新的环境里完成类似的任务。这一层考的是"做出来"。

以一个具体场景为例:AI看完一个"如何在Discord上修改账号密码"的教程视频,然后面对一个真实的手机界面,需要一步步地点击、滑动、输入,真正把密码改掉。这要求AI不仅记住了教程里的步骤,还能把这些步骤灵活地迁移到眼前这个可能略有差异的新界面上。这种能力,研究团队称之为"视频上下文学习",本质上就是"看视频长本事"。

二、VG-GUI-Bench:这道更难的考题长什么样

为了真正测试AI的这种高阶能力,清华大学团队设计了VG-GUI-Bench,一个包含1000个测试案例的基准测试集。每个案例都由两部分组成:一段操作教程视频,以及一个对应的手机界面操作任务。AI需要看完视频,然后在真实的手机界面上完成任务。

测试的数据来源于一个名为MONDAY的高质量数据集,研究团队从中获取了教程视频、标准操作序列以及关键截图作为评判依据。每个测试案例平均包含约10.71个操作步骤,这意味着AI需要持续地、连贯地做出一系列决策,而不是只答一个问题就结束——这就是所谓的"长时程任务",难度远高于单步问答。

为了让这套考试更加规范,研究团队还统一了"操作语言"。此前不同研究往往各自定义一套操作命令,混乱而缺乏一致性。这套新规范定义了六种标准操作:在屏幕某个坐标点击(CLICK),从一个位置滑动到另一个位置(SCROLL),输入文字(TYPE),按下系统按键比如返回或回车(PRESS),执行双指缩放手势(ZOOM),以及宣告任务完成(FINISH)。这六种操作覆盖了手机交互的核心场景,清晰明确,方便统一评判。

考试的流程是这样的:AI先接收一段教程视频,经过关键帧筛选模块处理后,得到若干代表性画面;这些画面与任务说明一起构成输入,AI据此预测下一步该执行的操作;操作被执行到真实的手机界面上,产生新的界面状态;AI再看着新状态,预测下一步操作……如此循环,直到任务完成。

为了全面评判AI的表现,研究团队设计了四个互补的评分维度。第一个叫"准确率",衡量每一步操作预测的正确程度:如果操作类型猜对了,得0.3分;如果类型和具体参数(比如点击的坐标)都猜对了,再加0.7分,合计满分1分。第二个叫"完成率",衡量每个任务中正确完成的步骤比例,再对所有任务取平均。第三个叫"效率",衡量每次预测平均消耗了多少帧视频画面,帧数越少说明筛选越高效。第四个叫"视频提升率",衡量看了视频之后比不看视频时准确率提升了多少,这个指标直接反映了AI从视频里"学到了多少东西"。

三、TASKER:像侦探一样在视频里找关键线索

考试设计好了,接下来的问题是:如何帮助AI更好地"看视频"?

一段教程视频可能长达几分钟甚至十几分钟,其中大部分画面都是无关紧要的过渡镜头、空白等待,或者重复操作。真正关键的信息,也许只集中在几秒钟之内。如果AI把每一帧都看一遍,既浪费时间,又容易被冗余信息干扰;如果只是随机抽几帧来看,又很可能错过最关键的那几个瞬间。

这就像侦探破案时面临的困境:案发现场留下了大量痕迹,大多数都是无关线索,真正指向凶手的关键证据可能只有几件。高明的侦探不会对每一条线索一视同仁,而是凭借对案件的理解,优先调查最有可能揭示真相的方向。

TASKER正是这样一位"智能侦探"。它的核心思路是把"找关键帧"这件事,建模成一个图搜索问题——就像在地图上找最优路径一样。视频被划分成若干片段,每个片段就是地图上的一个节点;TASKER的任务,就是找到那些"最值得深入探查"的节点,把它们进一步细分,直到找到足够有价值的关键帧。

具体来说,TASKER首先把视频均匀切成若干段,每段的起始帧和结束帧是"可见帧",其余帧暂时不可见。然后,它根据一个"代价函数"来判断哪个片段最值得进一步切分——把这个片段再一分为二,获取更多细节。如此反复,就像侦探逐步缩小嫌疑人范围一样,最终锁定关键画面。

TASKER有四种不同的搜索策略,分别对应四种不同的侦查风格。

第一种叫TASKER-GBFS,采用"贪婪最优优先"策略。它的侦查逻辑是:始终优先审查那个"最可能藏有关键线索"的片段。具体实现上,AI会评估当前可见帧,判断回答问题还缺少什么信息,然后估计这些缺失信息最可能出现在哪个片段里,优先把那个片段切开来看。这种策略目标明确,直奔最相关的内容,效率很高。

第二种叫TASKER-Dijkstra,采用"场景感知"策略。这种侦查方式不关心任务目标,而是专注于寻找视频本身结构上最重要的转折点。AI会评估每个片段的起始帧和结束帧之间的画面差异,选择差异最大的片段进行切分——因为画面变化越大,说明那里发生了重要的场景切换,很可能包含关键操作。这就像侦探不看案件档案,而是先把现场最显眼的异常点一一记下来。

第三种叫TASKER-A*,把前两种策略结合起来。它同时考虑两个因素:这个片段是否可能包含回答问题所需的信息,以及这个片段的画面变化是否显著。只有同时满足这两个条件的片段,才会被优先切分。这种策略兼顾了目标导向和结构感知,理论上是最全面的。

第四种叫TASKER-BFS,采用"广度优先"策略,不依赖AI来评估,而是均匀地把所有片段依次切分,像浪潮一样稳步推进。这种方式不需要复杂的推理,适合在无法使用大型AI模型的情况下使用,缺点是效率较低,处理的帧数更多。

搜索过程中,TASKER还有两个配套机制。一是"置信度评估":每次筛选出一批可见帧后,AI会尝试回答问题,并同时从两个角度评估自己的答案是否足够可靠。第一个角度是"自我反思",AI自己评判答案的准确性和可靠性,给出一个置信度分数。第二个角度是"时序总结",AI把所有可见帧的内容在时间维度上串联起来,形成一个连贯的视频概述,再基于这个整体认知给出答案和置信度。只有当两种评估方式都认为"信息已经足够了",搜索才会停止。这就像侦探在破案时,不仅要自己觉得证据充分,还要能向同事清晰地讲述整个案情,才算真正结案。

二是"帧验证":每次新切分出一帧,都会先检查它是否与已有帧高度重复,再检查它是否与当前任务相关。重复或无关的帧会被丢弃,相关帧的附近如果有更好的替代帧,会自动替换。那些只能产出冗余帧的片段,会被放入"冻结集合",不再重复探查。这套机制保证了最终选出的帧既不重复,又真正有用。

四、实验结果:TASKER在两类考试上都交出了亮眼成绩

研究团队在多个测试平台上验证了TASKER的效果,结果相当有说服力。

在传统视频问答测试上,研究团队选取了EgoSchema和NExT-QA两个广泛使用的数据集。EgoSchema专注于第一人称视角的长视频理解,每段视频约三分钟,人类答题准确率约为76%,而当时最好的AI模型也只能达到70%以下。NExT-QA则侧重于考察AI对视频中因果关系和时序关系的理解能力,问题分为因果类、时序类和描述类三种。

以GPT-4作为底层AI的TASKER,在EgoSchema完整测试集上达到了63.1%的准确率,比此前最好的基线方法(VideoTree)高出2.0个百分点;在NExT-QA上达到了77.4%的平均准确率,比最好的基线高出1.8个百分点。在因果、时序、描述三个子类上,TASKER也分别超越了最强对手。

更值得关注的是帧效率。在EgoSchema子集上,当所有方法处理相同数量的视频帧时,TASKER能达到更高的准确率。换一个角度来看:要达到相同的66%准确率,TASKER只需要处理大约VideoTree所需帧数的四分之一。而且,VideoTree在使用之前需要对视频的所有帧进行特征提取和聚类,TASKER则完全不需要这个预处理步骤——它只看"可见帧",其余帧根本不碰,大大减少了计算开销。整体来看,TASKER在达到相同性能时,大约只需处理全部帧数的15%左右。

在新设计的VG-GUI-Bench上,研究团队对比了多种方案。不看视频直接操作的基线,准确率最低(25.32%)。把所有关键帧都提供给AI的方案,准确率有所提升(37.21%),但这些帧数量多且不一定全部有用,效率较低。均匀采样10帧的方案表现稳定(39.82%),因为全局画面覆盖较好。而"作弊版"的最优参考(直接给AI看当前步骤对应的教程帧,还标注了正确的操作目标),准确率达到44.32%,但这种方式会让AI过度依赖视觉模仿,导致需要输入文字或按系统键的操作完全失败,因为这些操作没有视觉目标可以直接复制。

在这套对比中,TASKER-A*取得了最高的整体准确率(40.96%)和最高的视频提升率(0.618),意味着它从视频中学到的东西最多,对操作准确率的提升最为显著。TASKER-Dijkstra则在任务完成率上表现突出(74.39%),接近最优参考的上限(76.32%)。与VideoTree和VideoAgent相比,TASKER系列方法在更少的帧数下实现了更高的准确率,体现出更强的信息提取效率。

在更大范围的模型测评上,研究团队还构建了一个包含7个前沿模型的VG-GUI-Bench排行榜。谷歌的Gemini-3.1-Pro在所有条件下都排名第一,GPT-5-mini紧随其后,Kimi-K2.5排名第三。所有模型中,Seed-2.0-Pro在加入10帧视频后,准确率提升幅度最大,从35.93%跃升至39.78%。这说明视频确实能给AI带来有效的操作知识,即便只是均匀采样的少量帧。

五、内部拆解:哪些设计最关键

研究团队还对TASKER的各个设计选择做了细致的"拆解实验",逐一验证每个部分的贡献。

在搜索策略的对比上,TASKER-BFS虽然不需要AI进行代价函数评估,但它处理的帧数最多(平均31.2帧),准确率却最低(64.7%)。TASKER-GBFS(67.0%,平均27.3帧)和TASKER-Dijkstra(66.8%,平均27.6帧)都有明显提升,而TASKER-A*在准确率上再上一层(68.0%),代价仅是略微多处理了一点帧(27.9帧)。这说明任务驱动和场景感知两个维度确实是互补的,把它们结合起来能取得最佳效果。

在置信度评估机制上,单独使用"自我反思"方式得到67.4%的准确率,单独使用"时序总结"方式得到67.3%,而两者结合(投票机制)达到68.0%,同时帧数消耗也处于合理水平(27.9帧)。这表明两种评估方式从不同角度衡量信息充分性,结合起来更可靠。

在底层AI模型的选择上,GPT-4o是最佳选择(68.6%,帧效率也最高),GPT-4紧随其后(68.0%)。有意思的是,推理能力更强的o3-mini和Deepseek-R1反而略逊一筹,研究团队认为这可能是因为视觉推理任务并不需要特别复杂的逻辑链,过度"思考"反而不如快速判断有效。开源模型LLaMA-3.3-70B表现最弱(65.2%),但仍然优于许多之前的基线方法。

六、和视频理解AI的正面对比

有人可能会问:既然现在有那么多专门处理视频的AI模型,直接用它们不就好了?研究团队对这个问题给出了坦诚的回答。

从性能上看,顶尖的端到端视频AI确实比TASKER更强。比如VideoLLaMA2使用了720亿参数的巨型模型,在EgoSchema上达到63.9%,在NExT-QA上达到75.6%,与TASKER使用GPT-4的成绩接近甚至略有超出。但这类模型的训练成本极其惊人——VideoLLaMA2用了1360万条训练数据,需要32块80GB显存的A100显卡才能完成训练。ViLA虽然规模较小(40亿参数),训练成本也低一些,但在EgoSchema上没有提供完整结果。

TASKER的优势在于完全不需要训练,直接调用现成的AI模型即可使用,没有任何额外的训练开销。同时,它在推理阶段也更节省资源,因为只处理筛选后的少量关键帧,而不是整个视频的所有帧。此外,TASKER的推理过程是透明的——哪些帧被选中、为什么被选中、AI在每一步的推理是什么,都是可以追溯的,这在某些需要可解释性的应用场景中是重要优势。

研究团队的结论是:两类方法各有适用场景。如果对精度要求极高、不在乎计算成本,端到端视频AI是更好的选择;如果希望在性能和成本之间取得平衡,或者需要可解释性,TASKER这类无需训练的关键帧方法更实用。

说到底,这项研究揭示了一个被长期忽视的问题:我们对AI视频理解能力的评估,一直停留在太浅的层次上。就像只考学生认字,从不考他们能不能读懂一篇文章、能不能按照说明书组装家具一样,现有的测试体系给了我们一个虚假的安全感。

清华大学团队的两项贡献——VG-GUI-Bench和TASKER——分别从"提出更难的考题"和"提供更聪明的工具"两个方向,推动了这个领域向更实用的方向迈进。VG-GUI-Bench把"看视频学操作"这件事变成了一个可以量化、可以对比的测试;TASKER则像一个受过专业训练的助理,帮AI在浩如烟海的视频帧中精准定位最有价值的画面,同时兼顾了"找到了没有"和"花了多少时间"两个维度。

对普通用户来说,这项研究的意义在于:未来那些帮你"看视频学技能"的AI助手,也许会因为这类技术的进步而变得真正好用——不只是告诉你视频里发生了什么,而是真正帮你把视频里的知识转化为可执行的步骤,陪你一起完成任务。

对这项研究感兴趣的读者,可以通过arXiv编号2606.29445找到完整论文,也可以访问研究团队的项目页面和代码仓库获取更多技术细节。

Q&A

Q1:VG-GUI-Bench和普通的视频问答测试有什么本质区别?

A:普通视频问答只考察AI能否"看懂"视频里发生了什么,比如识别物体或动作,回答选择题就算完成。VG-GUI-Bench要求AI先看完操作教程视频,然后在真实的手机界面上一步步执行对应的操作,比如点击、滑动、输入文字,平均要完成约10.71个连续步骤。这考察的是AI能否把视频里的知识真正迁移到新环境中使用,难度远高于传统问答。

Q2:TASKER比均匀抽帧的方法好在哪里?

A:均匀抽帧是每隔固定时间取一帧,无论那个时间点有没有关键内容。TASKER则会根据任务需求和画面变化程度,动态决定在哪个时间段"深挖",优先选取那些最可能包含关键操作的片段进行细分。实验数据显示,要达到相同的答题准确率,TASKER处理的帧数大约只有VideoTree方法的四分之一,整体上只需要处理全部视频帧的约15%。

Q3:TASKER需要额外训练才能使用吗?

A:不需要。TASKER是一种完全免训练的方法,它利用现成的大型多模态AI模型(比如GPT-4o)来评估视频片段的重要性和回答的置信度,本身不需要任何额外的模型训练或数据标注。这意味着它可以直接搭配不同的底层AI模型使用,灵活性较高,部署成本也远低于需要大规模训练的端到端视频AI。



Powered by 万达娱乐账号注册 @2013-2022 RSS地图 HTML地图

Copyright Powered by站群系统 © 2013-2024