← 回作品

Refer-MOT

一般的多目標追蹤只看畫面:偵測、跨影格關聯、維持 ID。Refer-MOT 要追的是「用一句話描述的那個目標」,所以得讓追蹤器讀懂語言。

PYTHONPYTORCHOPENCVVLM
+53.5%
Refer-KITTI HOTA 提升
架構圖 / 系統示意(放你的圖)
問題

純視覺的追蹤器無法判斷「哪一個目標符合這句描述」;把語言條件硬加在後處理,語意和軌跡容易對不起來。

做法

設計多模態管線:ByteTrack 負責軌跡,視覺語言模型負責語意推理,再加一層 VQA 驗證迴圈——動態裁切候選物件送去問答,確保目標與文字提示真的對得上。

結果

Refer-KITTI 上 HOTA 由 14.08 提升到 21.62,相對提升 53.5%。後續的 GMC-Link 就是從這條線延伸出來的。