Aivora
arXivAI 研究專業

TrackEverything:透過去重 3D 表徵實現破紀錄的長序列全員稠密追蹤

TrackEverything: Breaking the Horizon Barrier in Dense 3D Point Tracking

2 分鐘閱讀
TrackEverything:透過去重 3D 表徵實現破紀錄的長序列全員稠密追蹤
30 秒看懂

傳統 3D 點追蹤模型長期面臨「稀疏長期追蹤」與「稠密短期追蹤」的兩難折衷。TrackEverything 透過將影片重新表徵為世界座標中的持久性 3D 場景軌跡來解決此問題。它引入了三大創新:在滑動窗口邊界進行體素化去重以合併重複軌跡、將追蹤拆分為端點預測與僅針對動態點的輕量化軌跡精鍊,以及使用高效的 3D WAFT 代替高耗能的 4D 相關體。這使其能以 40 GB 記憶體處理超千幀的稠密追蹤,且在 TAPVid-3D 基準測試中,短片段表現超越同類開源模型 20% 以上的 APD。

核心重點

01

體素化軌跡去重

在滑動窗口邊界自動合併空間中重合的軌跡,防止對同一表面進行重複觀測而導致記憶體無限膨脹。

02

兩階段追蹤分解

先以端點精鍊器判定靜態與動態點,隨後僅針對動態點進行輕量的軌跡重建,大幅降低運算負荷。

03

高效 3D WAFT 採樣

以點雲內的高效特徵採樣取代極度消耗記憶體的傳統 4D 相關體運算,優化記憶體配置。

04

超長序列稠密能力

首個成功在單張 40 GB GPU 限制下,對超過 1000 幀影片中的所有可見點進行完整 3D 追蹤的系統。

技術圖解

TrackEverything 軌跡處理解耦流程
滑動窗口合併重合點採樣特徵僅動態點靜態點旁路稠密軌跡輸入影片與場景體素化軌跡去重3D WAFT 特徵採樣端點精鍊與分類動態軌跡解碼世界座標持久 3D 軌跡

為什麼重要

這項研究成功打破了長序列影片中「稀疏」與「稠密」點追蹤無法兼得的技術瓶頸。透過結合 3D 物理幾何與去重技術,本方法證明了視訊理解不需要隨時間線性累積冗餘資料。這對於需要長期、高精度物理互動理解的領域(如機器人非剛性物體操縱、自動駕駛長距離軌跡預測、動態三維重建)帶來了顯著的效率與性能突破。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 產品經理

可以怎麼使用

  1. 1長序列動態 3D 場景重建與物理編輯
  2. 2機器人對非剛性物體的操作與精準物理互動追蹤
  3. 3自動駕駛中複雜動態障礙物與行人長距離軌跡分析

限制與注意事項

  • 高度依賴初始 3D 場景重建與深度估計的準確性
  • 在遭遇極端遮擋或劇烈光照變化的複雜場景時,追蹤穩定度仍面臨挑戰

延伸閱讀