TrackEverything:透過去重 3D 表徵實現破紀錄的長序列全員稠密追蹤
TrackEverything: Breaking the Horizon Barrier in Dense 3D Point Tracking
傳統 3D 點追蹤模型長期面臨「稀疏長期追蹤」與「稠密短期追蹤」的兩難折衷。TrackEverything 透過將影片重新表徵為世界座標中的持久性 3D 場景軌跡來解決此問題。它引入了三大創新:在滑動窗口邊界進行體素化去重以合併重複軌跡、將追蹤拆分為端點預測與僅針對動態點的輕量化軌跡精鍊,以及使用高效的 3D WAFT 代替高耗能的 4D 相關體。這使其能以 40 GB 記憶體處理超千幀的稠密追蹤,且在 TAPVid-3D 基準測試中,短片段表現超越同類開源模型 20% 以上的 APD。
核心重點
體素化軌跡去重
在滑動窗口邊界自動合併空間中重合的軌跡,防止對同一表面進行重複觀測而導致記憶體無限膨脹。
兩階段追蹤分解
先以端點精鍊器判定靜態與動態點,隨後僅針對動態點進行輕量的軌跡重建,大幅降低運算負荷。
高效 3D WAFT 採樣
以點雲內的高效特徵採樣取代極度消耗記憶體的傳統 4D 相關體運算,優化記憶體配置。
超長序列稠密能力
首個成功在單張 40 GB GPU 限制下,對超過 1000 幀影片中的所有可見點進行完整 3D 追蹤的系統。
技術圖解
為什麼重要
這項研究成功打破了長序列影片中「稀疏」與「稠密」點追蹤無法兼得的技術瓶頸。透過結合 3D 物理幾何與去重技術,本方法證明了視訊理解不需要隨時間線性累積冗餘資料。這對於需要長期、高精度物理互動理解的領域(如機器人非剛性物體操縱、自動駕駛長距離軌跡預測、動態三維重建)帶來了顯著的效率與性能突破。
對誰有影響
- AI 研究人員
- AI 開發者
- 產品經理
可以怎麼使用
- 1長序列動態 3D 場景重建與物理編輯
- 2機器人對非剛性物體的操作與精準物理互動追蹤
- 3自動駕駛中複雜動態障礙物與行人長距離軌跡分析
限制與注意事項
- 高度依賴初始 3D 場景重建與深度估計的準確性
- 在遭遇極端遮擋或劇烈光照變化的複雜場景時,追蹤穩定度仍面臨挑戰
延伸閱讀
突破多模態情緒分析瓶頸:SemMSA 藉由 LLM 潛在語意與無錨點頻譜對齊解決資料缺失問題
Overcoming Incomplete Data in MSA: SemMSA Harnesses LLM Latent Semantics and Spectral Alignment
本研究提出 SemMSA 框架,透過凍結的 LLM 提取潛在情緒語意,並運用無錨點的跨模態頻譜對齊,解決多模態情緒分析中因資料缺失導致的虛假生成與雜訊干擾。
不需重新訓練!PoEM 演算法直接預測新獎勵函數的強化學習結果
PoEM: Predicting RL Outcomes Without Re-training Existing Policies
PoEM 框架允許研究人員在不進行任何實際強化學習訓練的情況下,利用現有已對齊模型的對數空間線性組合,直接精準預測並合成適用於新獎勵函數的 AI 模型。

NVIDIA 推出首款開源 3D CT 醫療視覺語言模型 NV-Reason-CT,導入放射科醫師思考鏈推論
NVIDIA Introduces NV-Reason-CT: Open 3D CT VLM with Radiologist Chain-of-Thought Reasoning
NVIDIA 推出專為 3D 電腦斷層設計的開源視覺語言模型 NV-Reason-CT,結合 3D 視覺編碼器與 Qwen 語言模型,能模擬放射科醫師的思考鏈推論,生成結構化診斷報告並進行多輪問答。