@inproceedings{bb244800,
AUTHOR = "Azad, S. and Vineet, V. and Rawat, Y.S.",
TITLE = "HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video
Understanding",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "8545-8556",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239706"}
@inproceedings{bb244801,
AUTHOR = "Chen, W.X. and Liu, Y. and Chen, B.L. and Su, J.D. and Zheng, Y. and Lin, L.",
TITLE = "Cross-modal Causal Relation Alignment for Video Question Grounding",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "24087-24096",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239707"}
@inproceedings{bb244802,
AUTHOR = "Yi, J.H. and Wasim, S.T. and Luo, Y. and Naseer, M. and Gall, J.",
TITLE = "Video-Panda: Parameter-efficient Alignment for Encoder-free
Video-Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "24119-24128",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239708"}
@inproceedings{bb244803,
AUTHOR = "Islam, M.M. and Nagarajan, T. and Wang, H.Y. and Bertasius, G. and Torresani, L.",
TITLE = "BIMBA: Selective-Scan Compression for Long-Range Video Question
Answering",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "29096-29107",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239709"}
@inproceedings{bb244804,
AUTHOR = "Cheng, F. and Wang, Z.Y. and Sung, Y.L. and Lin, Y.B. and Bansal, M. and Bertasius, G.",
TITLE = "Dam: Dynamic Adapter Merging for Continual Video QA Learning",
BOOKTITLE = WACV25,
YEAR = "2025",
PAGES = "6805-6817",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239710"}
@inproceedings{bb244805,
AUTHOR = "Chen, X.Y. and Lin, Y. and Zhang, Y.C. and Huang, W.R.",
TITLE = "Autoeval-video: An Automatic Benchmark for Assessing Large Vision
Language Models in Open-ended Video Question Answering",
BOOKTITLE = ECCV24,
YEAR = "2024",
PAGES = "LXVIII: 179-195",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239711"}
@inproceedings{bb244806,
AUTHOR = "Wang, X. and Liang, J. and Wang, C.K. and Deng, K. and Lou, Y. and Lin, M.C. and Yang, S.",
TITLE = "Vila: Efficient Video-language Alignment for Video Question Answering",
BOOKTITLE = ECCV24,
YEAR = "2024",
PAGES = "LXII: 186-204",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239712"}
@inproceedings{bb244807,
AUTHOR = "Choudhury, R. and Niinuma, K. and Kitani, K.M. and Jeni, L.A.",
TITLE = "Video Question Answering with Procedural Programs",
BOOKTITLE = ECCV24,
YEAR = "2024",
PAGES = "XXXVIII: 315-332",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239713"}
@inproceedings{bb244808,
AUTHOR = "Xiao, J.B. and Yao, A. and Li, Y.C. and Chua, T.S.",
TITLE = "Can I Trust Your Answer? Visually Grounded Video Question Answering",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "13204-13214",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239714"}
@inproceedings{bb244809,
AUTHOR = "Min, J. and Buch, S. and Nagrani, A. and Cho, M. and Schmid, C.",
TITLE = "MoReVQA: Exploring Modular Reasoning Models for Video Question
Answering",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "13235-13245",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239715"}
@inproceedings{bb244810,
AUTHOR = "Zou, B. and Yang, C. and Qiao, Y. and Quan, C.B. and Zhao, Y.J.",
TITLE = "Language-aware Visual Semantic Distillation for Video Question
Answering",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "27103-27113",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239716"}
@inproceedings{bb244811,
AUTHOR = "Liang, T.M. and Tan, C.L. and Xia, B.H. and Zheng, W.S. and Hu, J.F.",
TITLE = "Ranking Distillation for Open-Ended Video Question Answering with
Insufficient Labels",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "13161-13170",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239717"}
@inproceedings{bb244812,
AUTHOR = "Wu, J.M. and Shu, P.C. and Hong, H.Y. and Ma, L. and Zhu, Y. and Wang, L.",
TITLE = "Pre-trained Bidirectional Dynamic Memory Network For Long Video
Question Answering",
BOOKTITLE = Crowded24,
YEAR = "2024",
PAGES = "5550-5557",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239718"}
@inproceedings{bb244813,
AUTHOR = "Inoue, Y. and Yada, Y. and Tanahashi, K. and Yamaguchi, Y.",
TITLE = "NuScenes-MQA: Integrated Evaluation of Captions and QA for Autonomous
Driving Datasets using Markup Annotations",
BOOKTITLE = LLVMCrive24,
YEAR = "2024",
PAGES = "930-938",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239719"}
@inproceedings{bb244814,
AUTHOR = "Park, S.Y. and Lee, M.J. and Kang, J.H. and Choi, H. and Park, Y. and Cho, J. and Lee, A. and Kim, D.K.",
TITLE = "VLAAD: Vision and Language Assistant for Autonomous Driving",
BOOKTITLE = LLVMCrive24,
YEAR = "2024",
PAGES = "980-987",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239720"}
@inproceedings{bb244815,
AUTHOR = "Fang, J.Z.Y. and Zheng, S. and Sharma, V. and Piramuthu, R.",
TITLE = "epislon-ViLM: Efficient Video-Language Model via Masked Video Modeling
with Semantic Vector-Quantized Tokenizer",
BOOKTITLE = Pretrain24,
YEAR = "2024",
PAGES = "529-540",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239721"}
@inproceedings{bb244816,
AUTHOR = "Zonneveld, A. and Gatt, A. and Calixto, I.",
TITLE = "Video-and-Language (VidL) models and their cognitive relevance",
BOOKTITLE = MMFM23,
YEAR = "2023",
PAGES = "325-338",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239722"}
@inproceedings{bb244817,
AUTHOR = "Momeni, L. and Caron, M. and Nagrani, A. and Zisserman, A. and Schmid, C.",
TITLE = "Verbs in Action: Improving verb understanding in video-language
models",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "15533-15545",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239723"}
@inproceedings{bb244818,
AUTHOR = "Jin, P. and Li, H. and Cheng, Z. and Li, K. and Ji, X.Y. and Liu, C. and Yuan, L. and Chen, J.",
TITLE = "DiffusionRet: Generative Text-Video Retrieval with Diffusion Model",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "2470-2481",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239724"}
@inproceedings{bb244819,
AUTHOR = "Li, P.D. and Xie, C.W. and Zhao, L.M. and Xie, H.T. and Ge, J.N. and Zheng, Y. and Zhao, D.L. and Zhang, Y.D.",
TITLE = "Progressive Spatio-Temporal Prototype Matching for Text-Video
Retrieval",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "4077-4087",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239725"}
@inproceedings{bb244820,
AUTHOR = "Guan, P.Y. and Pei, R.J. and Shao, B. and Liu, J.Z. and Li, W.M. and Gu, J.X. and Xu, H. and Xu, S.C. and Yan, Y. and Lam, E.Y.",
TITLE = "PIDRo: Parallel Isomeric Attention with Dynamic Routing for
Text-Video Retrieval",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "11130-11139",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239726"}
@inproceedings{bb244821,
AUTHOR = "Deng, C.R. and Chen, Q. and Qin, P.D. and Chen, D. and Wu, Q.",
TITLE = "Prompt Switch: Efficient CLIP Adaptation for Text-Video Retrieval",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "15602-15612",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239727"}
@inproceedings{bb244822,
AUTHOR = "Pirhadi, M.J. and Mirzaei, M. and Eetemadi, S.",
TITLE = "Just Ask Plus: Using Transcripts for VideoQA",
BOOKTITLE = ASI23,
YEAR = "2023",
PAGES = "3074-3077",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239728"}
@inproceedings{bb244823,
AUTHOR = "Ahmad, M. and Park, G. and Park, D. and Park, S.",
TITLE = "MMTF: Multi-Modal Temporal Fusion for Commonsense Video Question
Answering",
BOOKTITLE = VLAR23,
YEAR = "2023",
PAGES = "4659-4664",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239729"}
@inproceedings{bb244824,
AUTHOR = "Engin, D. and Avrithis, Y.",
TITLE = "Zero-Shot and Few-Shot Video Question Answering with Multi-Modal
Prompts",
BOOKTITLE = CLVL23,
YEAR = "2023",
PAGES = "2797-2802",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239730"}
@inproceedings{bb244825,
AUTHOR = "Nuthalapati, S.V. and Tunga, A.",
TITLE = "Coarse to Fine Frame Selection for Online Open-ended Video Question
Answering",
BOOKTITLE = MMFM23,
YEAR = "2023",
PAGES = "353-361",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239731"}
@inproceedings{bb244826,
AUTHOR = "Li, Y.C. and Xiao, J.B. and Feng, C. and Wang, X. and Chua, T.S.",
TITLE = "Discovering Spatio-Temporal Rationales for Video Question Answering",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "13823-13832",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239732"}
@inproceedings{bb244827,
AUTHOR = "Ko, D. and Lee, J.S. and Choi, M. and Chu, J.W. and Park, J. and Kim, H.W.J.",
TITLE = "Open-Vocabulary Video Question Answering: A New Benchmark for
Evaluating the Generalizability of Video Question Answering Models",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "3078-3089",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239733"}
@inproceedings{bb244828,
AUTHOR = "Li, J.T. and Niu, L. and Zhang, L.Q.",
TITLE = "Knowledge Proxy Intervention for Deconfounded Video Question
Answering",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "2770-2781",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239734"}
@inproceedings{bb244829,
AUTHOR = "Chen, G.Y. and Liu, X. and Wang, G. and Zhang, K. and Torr, P.H.S. and Zhang, X.P. and Tang, Y.S.",
TITLE = "Tem-adapter:
Adapting Image-Text Pretraining for Video Question Answer",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "13899-13909",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239735"}
@inproceedings{bb244830,
AUTHOR = "Jahagirdar, S. and Mathew, M. and Karatzas, D. and Jawahar, C.V.",
TITLE = "Understanding Video Scenes through Text:
Insights from Text-based Video Question Answering",
BOOKTITLE = VLAR23,
YEAR = "2023",
PAGES = "4648-4652",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239736"}
@inproceedings{bb244831,
AUTHOR = "Peng, M. and Liu, L.C. and Li, Z.H. and Shi, Y. and Zhou, X.D.",
TITLE = "Multi-Semantic Alignment Co-Reasoning Network for Video Question
Answering",
BOOKTITLE = ICIP23,
YEAR = "2023",
PAGES = "2090-2094",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239737"}
@inproceedings{bb244832,
AUTHOR = "Ye, S.H. and Kong, W.K. and Yao, C.L. and Ren, J.F. and Jiang, X.D.",
TITLE = "Video Question Answering Using Clip-Guided Visual-Text Attention",
BOOKTITLE = ICIP23,
YEAR = "2023",
PAGES = "81-85",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239738"}
@inproceedings{bb244833,
AUTHOR = "Khan, Z. and Kumar, B.V. and Schulter, S. and Yu, X. and Fu, Y. and Chandraker, M.",
TITLE = "Q: How to Specialize Large Vision-Language Models to Data-Scarce VQA
Tasks? A: Self-Train on Unlabeled Images!",
BOOKTITLE = CVPR23,
YEAR = "2023",
PAGES = "15005-15015",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239739"}
@inproceedings{bb244834,
AUTHOR = "Su, H.T. and Niu, Y. and Lin, X.D. and Hsu, W.H. and Chang, S.F.",
TITLE = "Language Models are Causal Knowledge Extractors for Zero-shot Video
Question Answering",
BOOKTITLE = L3D-IVU23,
YEAR = "2023",
PAGES = "4951-4960",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239740"}
@inproceedings{bb244835,
AUTHOR = "Zang, C.Q. and Wang, H.Q. and Pei, M.T. and Liang, W.",
TITLE = "Discovering the Real Association: Multimodal Causal Reasoning in
Video Question Answering",
BOOKTITLE = CVPR23,
YEAR = "2023",
PAGES = "19027-19036",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239741"}
@inproceedings{bb244836,
AUTHOR = "Gao, D.F. and Zhou, L. and Ji, L. and Zhu, L.C. and Yang, Y. and Shou, M.Z.",
TITLE = "MIST: Multi-modal Iterative Spatial-Temporal Transformer for
Long-form Video Question Answering",
BOOKTITLE = CVPR23,
YEAR = "2023",
PAGES = "14773-14783",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239742"}
@inproceedings{bb244837,
AUTHOR = "Khan, A.U. and Kuehne, H. and Wu, B. and Chheu, K. and Bousselham, W. and Gan, C. and Lobo, N. and Shah, M.",
TITLE = "Learning Situation Hyper-Graphs for Video Question Answering",
BOOKTITLE = CVPR23,
YEAR = "2023",
PAGES = "14879-14889",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239743"}
@inproceedings{bb244838,
AUTHOR = "Jahagirdar, S. and Mathew, M. and Karatzas, D. and Jawahar, C.V.",
TITLE = "Watching the News: Towards VideoQA Models that can Read",
BOOKTITLE = WACV23,
YEAR = "2023",
PAGES = "4430-4439",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239744"}
@inproceedings{bb244839,
AUTHOR = "Zhang, M.D. and Hwa, R. and Kovashka, A.",
TITLE = "How to Practice VQA on a Resource-limited Target Domain",
BOOKTITLE = WACV23,
YEAR = "2023",
PAGES = "4440-4449",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239745"}
@inproceedings{bb244840,
AUTHOR = "Lee, J. and Kang, W. and Kim, E.S.",
TITLE = "Dense but Efficient VideoQA for Intricate Compositional Reasoning",
BOOKTITLE = WACV23,
YEAR = "2023",
PAGES = "1114-1123",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239746"}
@inproceedings{bb244841,
AUTHOR = "Shen, R. and Inoue, N. and Shinoda, K.",
TITLE = "Text-Guided Object Detector for Multi-modal Video Question Answering",
BOOKTITLE = WACV23,
YEAR = "2023",
PAGES = "1032-1042",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239747"}
@inproceedings{bb244842,
AUTHOR = "Fang, S. and Wang, S.H. and Zhuo, J. and Han, X.Z. and Huang, Q.M.",
TITLE = "Learning Linguistic Association Towards Efficient Text-Video Retrieval",
BOOKTITLE = ECCV22,
YEAR = "2022",
PAGES = "XXXVI:254-270",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239748"}
@inproceedings{bb244843,
AUTHOR = "Piergiovanni, A.J. and Morton, K. and Kuo, W.C. and Ryoo, M.S. and Angelova, A.",
TITLE = "Video Question Answering with Iterative Video-Text Co-tokenization",
BOOKTITLE = ECCV22,
YEAR = "2022",
PAGES = "XXXVI:76-94",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239749"}
@inproceedings{bb244844,
AUTHOR = "Barmann, L. and Waibel, A.",
TITLE = "Where did I leave my keys?: Episodic-Memory-Based Question Answering
on Egocentric Videos",
BOOKTITLE = Ego4D-EPIC22,
YEAR = "2022",
PAGES = "1559-1567",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239750"}
@inproceedings{bb244845,
AUTHOR = "Li, J.T. and Niu, L. and Zhang, L.Q.",
TITLE = "From Representation to Reasoning: Towards both Evidence and
Commonsense Reasoning for Video Question-Answering",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "21241-21250",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239751"}
@inproceedings{bb244846,
AUTHOR = "Datta, S. and Dharur, S. and Cartillier, V. and Desai, R. and Khanna, M. and Batra, D. and Parikh, D.",
TITLE = "Episodic Memory Question Answering",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "19097-19106",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239752"}
@inproceedings{bb244847,
AUTHOR = "Gandhi, M. and Gul, M.O. and Prakash, E. and Grunde McLaughlin, M. and Krishna, R. and Agrawala, M.",
TITLE = "Measuring Compositional Consistency for Video Question Answering",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "5036-5045",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239753"}
@inproceedings{bb244848,
AUTHOR = "Gorti, S.K. and Vouitsis, N. and Ma, J.W. and Golestan, K. and Volkovs, M. and Garg, A. and Yu, G.W.",
TITLE = "X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "4996-5005",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239754"}
@inproceedings{bb244849,
AUTHOR = "Li, J.C. and Tang, S.L. and Zhu, L.C. and Shi, H. and Huang, X.W. and Wu, F. and Yang, Y. and Zhuang, Y.T.",
TITLE = "Adaptive Hierarchical Graph Reasoning with Semantic Coherence for
Video-and-Language Inference",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "1847-1857",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239755"}
@inproceedings{bb244850,
AUTHOR = "Zhang, M.X. and Yang, Y. and Chen, X. and Ji, Y.L. and Xu, X. and Li, J.J. and Shen, H.T.",
TITLE = "Multi-stage Aggregated Transformer Network for Temporal Language
Localization in Videos",
BOOKTITLE = CVPR21,
YEAR = "2021",
PAGES = "12664-12673",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239756"}
@inproceedings{bb244851,
AUTHOR = "Kim, N. and Ha, S.J. and Kang, J.W.",
TITLE = "Video Question Answering Using Language-Guided Deep Compressed-Domain
Video Feature",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "1688-1697",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239757"}
@inproceedings{bb244852,
AUTHOR = "Liu, F. and Liu, J. and Wang, W.N. and Lu, H.Q.",
TITLE = "HAIR: Hierarchical Visual-Semantic Relational Reasoning for Video
Question Answering",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "1678-1687",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239758"}
@inproceedings{bb244853,
AUTHOR = "Gao, D.F. and Wang, R.P. and Bai, Z. and Chen, X.L.",
TITLE = "Env-QA: A Video Question Answering Benchmark for Comprehensive
Understanding of Dynamic Environments",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "1655-1665",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239759"}
@inproceedings{bb244854,
AUTHOR = "Yun, H. and Yu, Y. and Yang, W. and Lee, K. and Kim, G.",
TITLE = "Pano-AVQA: Grounded Audio-Visual Question Answering on 360° Videos",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "2011-2021",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239760"}
@inproceedings{bb244855,
AUTHOR = "Xu, L. and Huang, H. and Liu, J.",
TITLE = "SUTD-TrafficQA: A Question Answering Benchmark and an Efficient
Network for Video Reasoning over Traffic Events",
BOOKTITLE = CVPR21,
YEAR = "2021",
PAGES = "9873-9883",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239761"}
@inproceedings{bb244856,
AUTHOR = "Park, J. and Lee, J.Y. and Sohn, K.H.",
TITLE = "Bridge to Answer: Structure-aware Graph Interaction Network for Video
Question Answering",
BOOKTITLE = CVPR21,
YEAR = "2021",
PAGES = "15521-15530",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239762"}
@inproceedings{bb244857,
AUTHOR = "Chen, X.W. and Liu, R. and Song, X.M. and Han, Y.H.",
TITLE = "Locating Visual Explanations for Video Question Answering",
BOOKTITLE = MMMod21,
YEAR = "2021",
PAGES = "I:290-302",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239763"}
@inproceedings{bb244858,
AUTHOR = "Garcia, N. and Nakashima, Y.",
TITLE = "Knowledge-based Video Question Answering with Unsupervised Scene
Descriptions",
BOOKTITLE = ECCV20,
YEAR = "2020",
PAGES = "XVIII:581-598",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239764"}
@inproceedings{bb244859,
AUTHOR = "Kim, J. and Ma, M. and Pham, T. and Kim, K. and Yoo, C.D.",
TITLE = "Modality Shifting Attention Network for Multi-Modal Video Question
Answering",
BOOKTITLE = CVPR20,
YEAR = "2020",
PAGES = "10103-10112",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239765"}
@inproceedings{bb244860,
AUTHOR = "Jiang, M. and Chen, S. and Yang, J. and Zhao, Q.",
TITLE = "Fantastic Answers and Where to Find Them: Immersive Question-Directed
Visual Attention",
BOOKTITLE = CVPR20,
YEAR = "2020",
PAGES = "2977-2986",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239766"}
@inproceedings{bb244861,
AUTHOR = "Yang, Z. and Garcia, N. and Chu, C. and Otani, M. and Nakashima, Y. and Takemura, H.",
TITLE = "BERT Representations for Video Question Answering",
BOOKTITLE = WACV20,
YEAR = "2020",
PAGES = "1545-1554",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239767"}
@inproceedings{bb244862,
AUTHOR = "Fan, C.Y. and Zhang, X.F. and Zhang, S. and Wang, W.S. and Zhang, C. and Huang, H.",
TITLE = "Heterogeneous Memory Enhanced Multimodal Attention Model for Video
Question Answering",
BOOKTITLE = CVPR19,
YEAR = "2019",
PAGES = "1999-2007",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239768"}
@inproceedings{bb244863,
AUTHOR = "Kim, J.Y. and Ma, M. and Kim, K. and Kim, S.J. and Yoo, C.D.",
TITLE = "Progressive Attention Memory Network for Movie Story Question Answering",
BOOKTITLE = CVPR19,
YEAR = "2019",
PAGES = "8329-8338",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239769"}
@inproceedings{bb244864,
AUTHOR = "Liu, C.N. and Chen, D.J. and Chen, H.T. and Liu, T.L.",
TITLE = "A2A: Attention to Attention Reasoning for Movie Question Answering",
BOOKTITLE = ACCV18,
YEAR = "2018",
PAGES = "VI:404-419",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239770"}
@inproceedings{bb244865,
AUTHOR = "Gao, J. and Ge, R. and Chen, K. and Nevatia, R.",
TITLE = "Motion-Appearance Co-memory Networks for Video Question Answering",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "6576-6585",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239771"}
@inproceedings{bb244866,
AUTHOR = "Kim, K.M. and Choi, S.H. and Kim, J.H. and Zhang, B.T.",
TITLE = "Multimodal Dual Attention Memory for Video Story Question Answering",
BOOKTITLE = ECCV18,
YEAR = "2018",
PAGES = "XV: 698-713",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239772"}
@inproceedings{bb244867,
AUTHOR = "Yu, Y.J. and Kim, J.S. and Kim, G.",
TITLE = "A Joint Sequence Fusion Model for Video Question Answering and
Retrieval",
BOOKTITLE = ECCV18,
YEAR = "2018",
PAGES = "VII: 487-503",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239773"}
@inproceedings{bb244868,
AUTHOR = "Hasan Chowdhury, M.I. and Nguyen, K. and Sridharan, S. and Fookes, C.",
TITLE = "Hierarchical Relational Attention for Video Question Answering",
BOOKTITLE = ICIP18,
YEAR = "2018",
PAGES = "599-603",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239774"}
@inproceedings{bb244869,
AUTHOR = "Mun, J. and Seo, P.H. and Jung, I. and Han, B.H.",
TITLE = "MarioQA: Answering Questions by Watching Gameplay Videos",
BOOKTITLE = ICCV17,
YEAR = "2017",
PAGES = "2886-2894",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239775"}
@inproceedings{bb244870,
AUTHOR = "Yu, Y. and Ko, H. and Choi, J. and Kim, G.",
TITLE = "End-to-End Concept Word Detection for Video Captioning, Retrieval,
and Question Answering",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "3261-3269",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239776"}
@article{bb244871,
AUTHOR = "Kafle, K. and Kanan, C.",
TITLE = "Visual question answering:
Datasets, algorithms, and future challenges",
JOURNAL = CVIU,
VOLUME = "163",
YEAR = "2017",
NUMBER = "1",
PAGES = "3-20",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239779"}
@article{bb244872,
AUTHOR = "Wu, Q. and Teney, D. and Wang, P. and Shen, C.H. and Dick, A. and van den Hengel, A.J.",
TITLE = "Visual question answering: A survey of methods and datasets",
JOURNAL = CVIU,
VOLUME = "163",
YEAR = "2017",
NUMBER = "1",
PAGES = "21-40",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239780"}
@article{bb244873,
AUTHOR = "Teney, D. and Wu, Q. and van den Hengel, A.J.",
TITLE = "Visual Question Answering: A Tutorial",
JOURNAL = SPMag,
VOLUME = "34",
YEAR = "2017",
NUMBER = "6",
MONTH = "November",
PAGES = "63-75",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239781"}
@inproceedings{bb244874,
AUTHOR = "Teney, D. and Liu, L. and van den Hengel, A.J.",
TITLE = "Graph-Structured Representations for Visual Question Answering",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "3233-3241",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239782"}
@inproceedings{bb244875,
AUTHOR = "Teney, D. and van den Hengel, A.J.",
TITLE = "Visual Question Answering as a Meta Learning Task",
BOOKTITLE = ECCV18,
YEAR = "2018",
PAGES = "XV: 229-245",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239783"}
@inproceedings{bb244876,
AUTHOR = "Teney, D. and Abbasnejad, E. and van den Hengel, A.J.",
TITLE = "Unshuffling Data for Improved Generalization in Visual Question
Answering",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "1397-1407",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239784"}
@article{bb244877,
AUTHOR = "Wu, Q. and Shen, C.H. and Wang, P. and Dick, A. and van den Hengel, A.J.",
TITLE = "Image Captioning and Visual Question Answering Based on Attributes
and External Knowledge",
JOURNAL = PAMI,
VOLUME = "40",
YEAR = "2018",
NUMBER = "6",
MONTH = "June",
PAGES = "1367-1381",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239785"}
@inproceedings{bb244878,
AUTHOR = "Wu, Q. and Wang, P. and Shen, C.H. and Dick, A. and van den Hengel, A.J.",
TITLE = "Ask Me Anything: Free-Form Visual Question Answering Based on
Knowledge from External Sources",
BOOKTITLE = CVPR16,
YEAR = "2016",
PAGES = "4622-4630",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239786"}
@article{bb244879,
AUTHOR = "Tommasi, T. and Mallya, A. and Plummer, B.A. and Lazebnik, S. and Berg, A.C. and Berg, T.L.",
TITLE = "Combining Multiple Cues for Visual Madlibs Question Answering",
JOURNAL = IJCV,
VOLUME = "127",
YEAR = "2019",
NUMBER = "1",
MONTH = "January",
PAGES = "38-60",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239787"}
@inproceedings{bb244880,
AUTHOR = "Tommasi, T. and Mallya, A. and Plummer, B.A. and Lazebnik, S. and Berg, A.C. and Berg, T.L.",
TITLE = "Solving Visual Madlibs with Multiple Cues",
BOOKTITLE = BMVC16,
YEAR = "2016",
PAGES = "xx-yy",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239788"}
@inproceedings{bb244881,
AUTHOR = "Yu, L.C. and Park, E. and Berg, A.C. and Berg, T.L.",
TITLE = "Visual Madlibs:
Fill in the Blank Description Generation and Question Answering",
BOOKTITLE = ICCV15,
YEAR = "2015",
PAGES = "2461-2469",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239789"}
@article{bb244882,
AUTHOR = "Liu, F. and Xiang, T. and Hospedales, T.M. and Yang, W.K. and Sun, C.Y.",
TITLE = "Inverse Visual Question Answering:
A New Benchmark and VQA Diagnosis Tool",
JOURNAL = PAMI,
VOLUME = "42",
YEAR = "2020",
NUMBER = "2",
MONTH = "February",
PAGES = "460-474",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239790"}
@inproceedings{bb244883,
AUTHOR = "Liu, F. and Xiang, T. and Hospedales, T.M. and Yang, W.K. and Sun, C.Y.",
TITLE = "iVQA: Inverse Visual Question Answering",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "8611-8619",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239791"}
@article{bb244884,
AUTHOR = "Patil, C. and Patwardhan, M.",
TITLE = "Visual Question Generation: The State of the Art",
JOURNAL = Surveys,
VOLUME = "53",
YEAR = "2020",
NUMBER = "3",
MONTH = "May",
PAGES = "xx-yy",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239792"}
@article{bb244885,
AUTHOR = "He, F.J. and Wang, Y.X. and Miao, X.L. and Sun, X.",
TITLE = "Interpretable visual reasoning: A survey",
JOURNAL = IVC,
VOLUME = "112",
YEAR = "2021",
PAGES = "104194",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239793"}
@article{bb244886,
AUTHOR = "Sharma, H. and Jalal, A.S.",
TITLE = "A survey of methods, datasets and evaluation metrics for visual
question answering",
JOURNAL = IVC,
VOLUME = "116",
YEAR = "2021",
PAGES = "104327",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239794"}
@article{bb244887,
AUTHOR = "Yang, L. and Jiang, H. and Song, Q. and Guo, J.",
TITLE = "A Survey on Long-Tailed Visual Recognition",
JOURNAL = IJCV,
VOLUME = "130",
YEAR = "2022",
NUMBER = "7",
MONTH = "July",
PAGES = "1837-1872",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239795"}
@article{bb244888,
AUTHOR = "Zhao, W.L. and Rao, Y.M. and Tang, Y.S. and Zhou, J. and Lu, J.W.",
TITLE = "VideoABC: A Real-World Video Dataset for Abductive Visual Reasoning",
JOURNAL = IP,
VOLUME = "31",
YEAR = "2022",
PAGES = "6048-6061",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239796"}
@article{bb244889,
AUTHOR = "Lahouti, F. and Kostina, V. and Hassibi, B.",
TITLE = "How to Query an Oracle? Efficient Strategies to Label Data",
JOURNAL = PAMI,
VOLUME = "44",
YEAR = "2022",
NUMBER = "11",
MONTH = "November",
PAGES = "7597-7609",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239797"}
@article{bb244890,
AUTHOR = "Ma, J. and Wang, P.H. and Kong, D.C. and Wang, Z.W. and Liu, J. and Pei, H.B. and Zhao, J.Z.",
TITLE = "Robust Visual Question Answering: Datasets, Methods, and Future
Challenges",
JOURNAL = PAMI,
VOLUME = "46",
YEAR = "2024",
NUMBER = "8",
MONTH = "August",
PAGES = "5575-5594",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239798"}
@article{bb244891,
AUTHOR = "Li, K. and Vosselman, G. and Yang, M.Y.",
TITLE = "HRVQA: A Visual Question Answering benchmark for high-resolution
aerial images",
JOURNAL = PandRS,
VOLUME = "214",
YEAR = "2024",
PAGES = "65-81",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239799"}
@inproceedings{bb244892,
AUTHOR = "Chen, C.Y. and Liu, M.C. and Codella, N. and Li, Y.S. and Yuan, L. and Gurari, D.",
TITLE = "Fully Authentic Visual Question Answering Dataset from Online
Communities",
BOOKTITLE = ECCV24,
YEAR = "2024",
PAGES = "XLVIII: 252-269",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239800"}
@inproceedings{bb244893,
AUTHOR = "Singh, M. and Patvardhan, C. and Lakshmi, C.V.",
TITLE = "Does ChatGPT Spell the End of Automatic Question Generation Research?",
BOOKTITLE = ICCVMI23,
YEAR = "2023",
PAGES = "1-6",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239801"}
@inproceedings{bb244894,
AUTHOR = "Zhu, L. and Ning, R. and Li, J. and Xin, C.S. and Wu, H.Y.",
TITLE = "Most and Least Retrievable Images in Visual-Language Query Systems",
BOOKTITLE = ECCV22,
YEAR = "2022",
PAGES = "XXXVII:1-18",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239802"}
@inproceedings{bb244895,
AUTHOR = "Salewski, L. and Emde, C. and Do, V. and Akata, Z. and Lukasiewicz, T.",
TITLE = "e-ViL: A Dataset and Benchmark for Natural Language Explanations in
Vision-Language Tasks",
BOOKTITLE = ICCV21,
YEAR = "2021",
PAGES = "1224-1234",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239803"}
@inproceedings{bb244896,
AUTHOR = "Gupta, V. and Patro, B.N. and Parihar, H. and Namboodiri, V.P.",
TITLE = "VQuAD: Video Question Answering Diagnostic Dataset",
BOOKTITLE = Novelty22,
YEAR = "2022",
PAGES = "282-291",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239804"}
@inproceedings{bb244897,
AUTHOR = "Nishimura, T. and Sakoda, K. and Hashimoto, A. and Ushiku, Y. and Tanaka, N. and Ono, F. and Kameko, H. and Mori, S.",
TITLE = "Egocentric Biochemical Video-and-Language Dataset",
BOOKTITLE = CLVL21,
YEAR = "2021",
PAGES = "3122-3126",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239805"}
@inproceedings{bb244898,
AUTHOR = "Zhang, M.D. and Maidment, T. and Diab, A. and Kovashka, A. and Hwa, R.",
TITLE = "Domain-robust VQA with diverse datasets and methods but no target
labels",
BOOKTITLE = CVPR21,
YEAR = "2021",
PAGES = "7042-7052",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239806"}
@inproceedings{bb244899,
AUTHOR = "Mathew, M. and Karatzas, D. and Jawahar, C.V.",
TITLE = "DocVQA: A Dataset for VQA on Document Images",
BOOKTITLE = WACV21,
YEAR = "2021",
PAGES = "2199-2208",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239807"}
Last update:Aug 19, 2026 at 13:26:35