arXivAI 研究
免 3D 結構與重構解碼器!VideoMSN 利用超大型圖片將影像分類器轉化為高效視訊學習器
VideoMSN: Turning Image Classifiers into Efficient Video Learners via Super-Images
VideoMSN 是一個基於自監督 Masked Siamese 網路的框架,它將視訊訊框組合成「超大型圖片」,並利用標準影像 ViT 與雙重遮罩機制,以極低的預訓練成本實現領先的視訊特徵學習。
2 分鐘閱讀
#videomsn
1 篇文章
VideoMSN: Turning Image Classifiers into Efficient Video Learners via Super-Images
VideoMSN 是一個基於自監督 Masked Siamese 網路的框架,它將視訊訊框組合成「超大型圖片」,並利用標準影像 ViT 與雙重遮罩機制,以極低的預訓練成本實現領先的視訊特徵學習。