ViTeX-Bench:解決影片場景文字編輯難題的首個高保真基準測試
ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
現有的影片編輯模型在進行局部修改時,特別是針對招牌或商品標籤上的「場景文字」,往往面臨文字隨時間扭曲或破壞周圍背景的問題。為此,本研究推出 ViTeX-Bench 基準測試套件,包含由 387 個真實 720p 影片組成的資料集,以及涵蓋文字正確性、視覺品質與局部性等 3 大維度、共 13 項指標的評估協定。此外,團隊微調並釋出 14B 的參考編輯器模型,在多項指標上取得領先表現。
核心重點
真實世界影片資料集
包含 387 個 720p 真實影片,附帶文字遮罩與編輯指令。其中 230 個用於訓練,157 個作為凍結的評估集。
三軸評估協定
透過 13 項指標評估文字正確性、視覺與時間品質、編輯局部性,並結合 OCR 校準與人類評估。
開源 14B 參考模型
推出 ViTeX-Edit-14B 編輯器,採用運動對齊字形影片條件微調,取得 0.688 的高字元準確度(CharAcc)。
為什麼重要
在影片中精準修改文字(例如將路標翻譯成多國語言或修正包裝標籤)是後製與本地化產業的剛性需求。過去缺乏客觀的基準,使得模型難以在「文字不扭曲」與「背景不模糊、不閃爍」之間取得平衡。ViTeX-Bench 填補了這一空白,為未來的影片編輯技術提供了標準化的實驗基礎。
對誰有影響
- AI 開發者
- AI 研究人員
- 內容創作者
可以怎麼使用
- 1跨國影片在地化(將影片背景中的招牌、海報文字翻譯為在地語言)
- 2影片特效與商業後製(不需重新拍攝,直接修正動態產品包裝上的印刷錯誤)
限制與注意事項
- 現有基準模型在同時維持「文字準確性」、「時間穩定性」與「局部背景完整性」上仍面臨顯著的技術瓶頸。
- 評估資料集主要涵蓋 720p 解析度的真實影片,對於極高動態模糊、極暗場景或更高解析度的泛化能力仍待驗證。
延伸閱讀

NVIDIA VSS Blueprint 3.3 登場:以智慧採樣與 AI 代理技能,大幅降低視覺 AI 部署成本
NVIDIA VSS Blueprint 3.3: Lowering Visual AI Agent Costs with Smart Sampling and Agent Skills
NVIDIA 推出 VSS Blueprint 3.3,透過全新的視覺代理建構技能與自適應高效視訊採樣(Adaptive EVS)技術,大幅簡化多工作流開發流程並減少高達 80% 的 VLM 輸入 Token,顯著降低開發與運行成本。
超越時間線:利用「實體自傳」增強 AI 的長影片記憶與物體追蹤能力
Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies
本研究提出 Grounded Entity Biographies (GEB) 記憶框架,將影片中同一物理實體的跨片段視覺觀測,自動串聯成可檢索的「實體自傳」,大幅提升 AI 在長達數天之長影片問答中的物體追蹤與識別能力。
突破均勻分佈陷阱:透過 SplitMoE 解決影片擴散模型的擴展瓶頸
Breaking the Uniformity Trap: Scaling Video Diffusion Models via SplitMoE
本研究提出 SplitMoE 架構,將專家網路拆分為「語意專家」與「通用專家」,解決傳統 MoE 因強制平衡路由而導致的影片畫面割裂問題,顯著提升影片生成的連貫性與收斂速度。