Structured Spatio-Temporal Evidence Graphs for Open-Vocabulary Object Retrieval in Videos
Open-vocabulary object retrieval in videos requires answering free-form object queries under bounded query-time cost. Existing index-based systems typically store independent frame-level regions and retrieve them with vision-language similarity, which is effective for appearance queries but mismatched with predicates w...