Aivora
arXiv影片 AI進階

ViTeX-Bench:解決影片場景文字編輯難題的首個高保真基準測試

ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing

2 分鐘閱讀
ViTeX-Bench:解決影片場景文字編輯難題的首個高保真基準測試
30 秒看懂

現有的影片編輯模型在進行局部修改時,特別是針對招牌或商品標籤上的「場景文字」,往往面臨文字隨時間扭曲或破壞周圍背景的問題。為此,本研究推出 ViTeX-Bench 基準測試套件,包含由 387 個真實 720p 影片組成的資料集,以及涵蓋文字正確性、視覺品質與局部性等 3 大維度、共 13 項指標的評估協定。此外,團隊微調並釋出 14B 的參考編輯器模型,在多項指標上取得領先表現。

核心重點

01

真實世界影片資料集

包含 387 個 720p 真實影片,附帶文字遮罩與編輯指令。其中 230 個用於訓練,157 個作為凍結的評估集。

02

三軸評估協定

透過 13 項指標評估文字正確性、視覺與時間品質、編輯局部性,並結合 OCR 校準與人類評估。

03

開源 14B 參考模型

推出 ViTeX-Edit-14B 編輯器,採用運動對齊字形影片條件微調,取得 0.688 的高字元準確度(CharAcc)。

為什麼重要

在影片中精準修改文字(例如將路標翻譯成多國語言或修正包裝標籤)是後製與本地化產業的剛性需求。過去缺乏客觀的基準,使得模型難以在「文字不扭曲」與「背景不模糊、不閃爍」之間取得平衡。ViTeX-Bench 填補了這一空白,為未來的影片編輯技術提供了標準化的實驗基礎。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 內容創作者

可以怎麼使用

  1. 1跨國影片在地化(將影片背景中的招牌、海報文字翻譯為在地語言)
  2. 2影片特效與商業後製(不需重新拍攝,直接修正動態產品包裝上的印刷錯誤)

限制與注意事項

  • 現有基準模型在同時維持「文字準確性」、「時間穩定性」與「局部背景完整性」上仍面臨顯著的技術瓶頸。
  • 評估資料集主要涵蓋 720p 解析度的真實影片,對於極高動態模糊、極暗場景或更高解析度的泛化能力仍待驗證。

延伸閱讀

超越時間線:利用「實體自傳」增強 AI 的長影片記憶與物體追蹤能力
arXiv影片 AI

超越時間線:利用「實體自傳」增強 AI 的長影片記憶與物體追蹤能力

Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies

本研究提出 Grounded Entity Biographies (GEB) 記憶框架,將影片中同一物理實體的跨片段視覺觀測,自動串聯成可檢索的「實體自傳」,大幅提升 AI 在長達數天之長影片問答中的物體追蹤與識別能力。

2 分鐘閱讀
突破均勻分佈陷阱:透過 SplitMoE 解決影片擴散模型的擴展瓶頸
arXiv影片 AI

突破均勻分佈陷阱:透過 SplitMoE 解決影片擴散模型的擴展瓶頸

Breaking the Uniformity Trap: Scaling Video Diffusion Models via SplitMoE

本研究提出 SplitMoE 架構,將專家網路拆分為「語意專家」與「通用專家」,解決傳統 MoE 因強制平衡路由而導致的影片畫面割裂問題,顯著提升影片生成的連貫性與收斂速度。

2 分鐘閱讀