@inproceedings{bb244800,
        AUTHOR = "Azad, S. and Vineet, V. and Rawat, Y.S.",
        TITLE = "HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video
Understanding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "8545-8556",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239706"}

@inproceedings{bb244801,
        AUTHOR = "Chen, W.X. and Liu, Y. and Chen, B.L. and Su, J.D. and Zheng, Y. and Lin, L.",
        TITLE = "Cross-modal Causal Relation Alignment for Video Question Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "24087-24096",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239707"}

@inproceedings{bb244802,
        AUTHOR = "Yi, J.H. and Wasim, S.T. and Luo, Y. and Naseer, M. and Gall, J.",
        TITLE = "Video-Panda: Parameter-efficient Alignment for Encoder-free
Video-Language Models",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "24119-24128",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239708"}

@inproceedings{bb244803,
        AUTHOR = "Islam, M.M. and Nagarajan, T. and Wang, H.Y. and Bertasius, G. and Torresani, L.",
        TITLE = "BIMBA: Selective-Scan Compression for Long-Range Video Question
Answering",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "29096-29107",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239709"}

@inproceedings{bb244804,
        AUTHOR = "Cheng, F. and Wang, Z.Y. and Sung, Y.L. and Lin, Y.B. and Bansal, M. and Bertasius, G.",
        TITLE = "Dam: Dynamic Adapter Merging for Continual Video QA Learning",
        BOOKTITLE = WACV25,
        YEAR = "2025",
        PAGES = "6805-6817",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239710"}

@inproceedings{bb244805,
        AUTHOR = "Chen, X.Y. and Lin, Y. and Zhang, Y.C. and Huang, W.R.",
        TITLE = "Autoeval-video: An Automatic Benchmark for Assessing Large Vision
Language Models in Open-ended Video Question Answering",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXVIII: 179-195",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239711"}

@inproceedings{bb244806,
        AUTHOR = "Wang, X. and Liang, J. and Wang, C.K. and Deng, K. and Lou, Y. and Lin, M.C. and Yang, S.",
        TITLE = "Vila: Efficient Video-language Alignment for Video Question Answering",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXII: 186-204",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239712"}

@inproceedings{bb244807,
        AUTHOR = "Choudhury, R. and Niinuma, K. and Kitani, K.M. and Jeni, L.A.",
        TITLE = "Video Question Answering with Procedural Programs",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXXVIII: 315-332",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239713"}

@inproceedings{bb244808,
        AUTHOR = "Xiao, J.B. and Yao, A. and Li, Y.C. and Chua, T.S.",
        TITLE = "Can I Trust Your Answer? Visually Grounded Video Question Answering",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13204-13214",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239714"}

@inproceedings{bb244809,
        AUTHOR = "Min, J. and Buch, S. and Nagrani, A. and Cho, M. and Schmid, C.",
        TITLE = "MoReVQA: Exploring Modular Reasoning Models for Video Question
Answering",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13235-13245",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239715"}

@inproceedings{bb244810,
        AUTHOR = "Zou, B. and Yang, C. and Qiao, Y. and Quan, C.B. and Zhao, Y.J.",
        TITLE = "Language-aware Visual Semantic Distillation for Video Question
Answering",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "27103-27113",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239716"}

@inproceedings{bb244811,
        AUTHOR = "Liang, T.M. and Tan, C.L. and Xia, B.H. and Zheng, W.S. and Hu, J.F.",
        TITLE = "Ranking Distillation for Open-Ended Video Question Answering with
Insufficient Labels",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13161-13170",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239717"}

@inproceedings{bb244812,
        AUTHOR = "Wu, J.M. and Shu, P.C. and Hong, H.Y. and Ma, L. and Zhu, Y. and Wang, L.",
        TITLE = "Pre-trained Bidirectional Dynamic Memory Network For Long Video
Question Answering",
        BOOKTITLE = Crowded24,
        YEAR = "2024",
        PAGES = "5550-5557",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239718"}

@inproceedings{bb244813,
        AUTHOR = "Inoue, Y. and Yada, Y. and Tanahashi, K. and Yamaguchi, Y.",
        TITLE = "NuScenes-MQA: Integrated Evaluation of Captions and QA for Autonomous
Driving Datasets using Markup Annotations",
        BOOKTITLE = LLVMCrive24,
        YEAR = "2024",
        PAGES = "930-938",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239719"}

@inproceedings{bb244814,
        AUTHOR = "Park, S.Y. and Lee, M.J. and Kang, J.H. and Choi, H. and Park, Y. and Cho, J. and Lee, A. and Kim, D.K.",
        TITLE = "VLAAD: Vision and Language Assistant for Autonomous Driving",
        BOOKTITLE = LLVMCrive24,
        YEAR = "2024",
        PAGES = "980-987",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239720"}

@inproceedings{bb244815,
        AUTHOR = "Fang, J.Z.Y. and Zheng, S. and Sharma, V. and Piramuthu, R.",
        TITLE = "epislon-ViLM: Efficient Video-Language Model via Masked Video Modeling
with Semantic Vector-Quantized Tokenizer",
        BOOKTITLE = Pretrain24,
        YEAR = "2024",
        PAGES = "529-540",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239721"}

@inproceedings{bb244816,
        AUTHOR = "Zonneveld, A. and Gatt, A. and Calixto, I.",
        TITLE = "Video-and-Language (VidL) models and their cognitive relevance",
        BOOKTITLE = MMFM23,
        YEAR = "2023",
        PAGES = "325-338",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239722"}

@inproceedings{bb244817,
        AUTHOR = "Momeni, L. and Caron, M. and Nagrani, A. and Zisserman, A. and Schmid, C.",
        TITLE = "Verbs in Action: Improving verb understanding in video-language
models",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "15533-15545",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239723"}

@inproceedings{bb244818,
        AUTHOR = "Jin, P. and Li, H. and Cheng, Z. and Li, K. and Ji, X.Y. and Liu, C. and Yuan, L. and Chen, J.",
        TITLE = "DiffusionRet: Generative Text-Video Retrieval with Diffusion Model",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2470-2481",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239724"}

@inproceedings{bb244819,
        AUTHOR = "Li, P.D. and Xie, C.W. and Zhao, L.M. and Xie, H.T. and Ge, J.N. and Zheng, Y. and Zhao, D.L. and Zhang, Y.D.",
        TITLE = "Progressive Spatio-Temporal Prototype Matching for Text-Video
Retrieval",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "4077-4087",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239725"}

@inproceedings{bb244820,
        AUTHOR = "Guan, P.Y. and Pei, R.J. and Shao, B. and Liu, J.Z. and Li, W.M. and Gu, J.X. and Xu, H. and Xu, S.C. and Yan, Y. and Lam, E.Y.",
        TITLE = "PIDRo: Parallel Isomeric Attention with Dynamic Routing for
Text-Video Retrieval",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "11130-11139",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239726"}

@inproceedings{bb244821,
        AUTHOR = "Deng, C.R. and Chen, Q. and Qin, P.D. and Chen, D. and Wu, Q.",
        TITLE = "Prompt Switch: Efficient CLIP Adaptation for Text-Video Retrieval",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "15602-15612",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239727"}

@inproceedings{bb244822,
        AUTHOR = "Pirhadi, M.J. and Mirzaei, M. and Eetemadi, S.",
        TITLE = "Just Ask Plus: Using Transcripts for VideoQA",
        BOOKTITLE = ASI23,
        YEAR = "2023",
        PAGES = "3074-3077",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239728"}

@inproceedings{bb244823,
        AUTHOR = "Ahmad, M. and Park, G. and Park, D. and Park, S.",
        TITLE = "MMTF: Multi-Modal Temporal Fusion for Commonsense Video Question
Answering",
        BOOKTITLE = VLAR23,
        YEAR = "2023",
        PAGES = "4659-4664",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239729"}

@inproceedings{bb244824,
        AUTHOR = "Engin, D. and Avrithis, Y.",
        TITLE = "Zero-Shot and Few-Shot Video Question Answering with Multi-Modal
Prompts",
        BOOKTITLE = CLVL23,
        YEAR = "2023",
        PAGES = "2797-2802",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239730"}

@inproceedings{bb244825,
        AUTHOR = "Nuthalapati, S.V. and Tunga, A.",
        TITLE = "Coarse to Fine Frame Selection for Online Open-ended Video Question
Answering",
        BOOKTITLE = MMFM23,
        YEAR = "2023",
        PAGES = "353-361",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239731"}

@inproceedings{bb244826,
        AUTHOR = "Li, Y.C. and Xiao, J.B. and Feng, C. and Wang, X. and Chua, T.S.",
        TITLE = "Discovering Spatio-Temporal Rationales for Video Question Answering",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "13823-13832",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239732"}

@inproceedings{bb244827,
        AUTHOR = "Ko, D. and Lee, J.S. and Choi, M. and Chu, J.W. and Park, J. and Kim, H.W.J.",
        TITLE = "Open-Vocabulary Video Question Answering: A New Benchmark for
Evaluating the Generalizability of Video Question Answering Models",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "3078-3089",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239733"}

@inproceedings{bb244828,
        AUTHOR = "Li, J.T. and Niu, L. and Zhang, L.Q.",
        TITLE = "Knowledge Proxy Intervention for Deconfounded Video Question
Answering",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2770-2781",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239734"}

@inproceedings{bb244829,
        AUTHOR = "Chen, G.Y. and Liu, X. and Wang, G. and Zhang, K. and Torr, P.H.S. and Zhang, X.P. and Tang, Y.S.",
        TITLE = "Tem-adapter:
Adapting Image-Text Pretraining for Video Question Answer",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "13899-13909",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239735"}

@inproceedings{bb244830,
        AUTHOR = "Jahagirdar, S. and Mathew, M. and Karatzas, D. and Jawahar, C.V.",
        TITLE = "Understanding Video Scenes through Text:
Insights from Text-based Video Question Answering",
        BOOKTITLE = VLAR23,
        YEAR = "2023",
        PAGES = "4648-4652",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239736"}

@inproceedings{bb244831,
        AUTHOR = "Peng, M. and Liu, L.C. and Li, Z.H. and Shi, Y. and Zhou, X.D.",
        TITLE = "Multi-Semantic Alignment Co-Reasoning Network for Video Question
Answering",
        BOOKTITLE = ICIP23,
        YEAR = "2023",
        PAGES = "2090-2094",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239737"}

@inproceedings{bb244832,
        AUTHOR = "Ye, S.H. and Kong, W.K. and Yao, C.L. and Ren, J.F. and Jiang, X.D.",
        TITLE = "Video Question Answering Using Clip-Guided Visual-Text Attention",
        BOOKTITLE = ICIP23,
        YEAR = "2023",
        PAGES = "81-85",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239738"}

@inproceedings{bb244833,
        AUTHOR = "Khan, Z. and Kumar, B.V. and Schulter, S. and Yu, X. and Fu, Y. and Chandraker, M.",
        TITLE = "Q: How to Specialize Large Vision-Language Models to Data-Scarce VQA
Tasks? A: Self-Train on Unlabeled Images!",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "15005-15015",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239739"}

@inproceedings{bb244834,
        AUTHOR = "Su, H.T. and Niu, Y. and Lin, X.D. and Hsu, W.H. and Chang, S.F.",
        TITLE = "Language Models are Causal Knowledge Extractors for Zero-shot Video
Question Answering",
        BOOKTITLE = L3D-IVU23,
        YEAR = "2023",
        PAGES = "4951-4960",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239740"}

@inproceedings{bb244835,
        AUTHOR = "Zang, C.Q. and Wang, H.Q. and Pei, M.T. and Liang, W.",
        TITLE = "Discovering the Real Association: Multimodal Causal Reasoning in
Video Question Answering",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "19027-19036",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239741"}

@inproceedings{bb244836,
        AUTHOR = "Gao, D.F. and Zhou, L. and Ji, L. and Zhu, L.C. and Yang, Y. and Shou, M.Z.",
        TITLE = "MIST: Multi-modal Iterative Spatial-Temporal Transformer for
Long-form Video Question Answering",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "14773-14783",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239742"}

@inproceedings{bb244837,
        AUTHOR = "Khan, A.U. and Kuehne, H. and Wu, B. and Chheu, K. and Bousselham, W. and Gan, C. and Lobo, N. and Shah, M.",
        TITLE = "Learning Situation Hyper-Graphs for Video Question Answering",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "14879-14889",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239743"}

@inproceedings{bb244838,
        AUTHOR = "Jahagirdar, S. and Mathew, M. and Karatzas, D. and Jawahar, C.V.",
        TITLE = "Watching the News: Towards VideoQA Models that can Read",
        BOOKTITLE = WACV23,
        YEAR = "2023",
        PAGES = "4430-4439",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239744"}

@inproceedings{bb244839,
        AUTHOR = "Zhang, M.D. and Hwa, R. and Kovashka, A.",
        TITLE = "How to Practice VQA on a Resource-limited Target Domain",
        BOOKTITLE = WACV23,
        YEAR = "2023",
        PAGES = "4440-4449",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239745"}

@inproceedings{bb244840,
        AUTHOR = "Lee, J. and Kang, W. and Kim, E.S.",
        TITLE = "Dense but Efficient VideoQA for Intricate Compositional Reasoning",
        BOOKTITLE = WACV23,
        YEAR = "2023",
        PAGES = "1114-1123",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239746"}

@inproceedings{bb244841,
        AUTHOR = "Shen, R. and Inoue, N. and Shinoda, K.",
        TITLE = "Text-Guided Object Detector for Multi-modal Video Question Answering",
        BOOKTITLE = WACV23,
        YEAR = "2023",
        PAGES = "1032-1042",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239747"}

@inproceedings{bb244842,
        AUTHOR = "Fang, S. and Wang, S.H. and Zhuo, J. and Han, X.Z. and Huang, Q.M.",
        TITLE = "Learning Linguistic Association Towards Efficient Text-Video Retrieval",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXVI:254-270",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239748"}

@inproceedings{bb244843,
        AUTHOR = "Piergiovanni, A.J. and Morton, K. and Kuo, W.C. and Ryoo, M.S. and Angelova, A.",
        TITLE = "Video Question Answering with Iterative Video-Text Co-tokenization",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXVI:76-94",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239749"}

@inproceedings{bb244844,
        AUTHOR = "Barmann, L. and Waibel, A.",
        TITLE = "Where did I leave my keys?: Episodic-Memory-Based Question Answering
on Egocentric Videos",
        BOOKTITLE = Ego4D-EPIC22,
        YEAR = "2022",
        PAGES = "1559-1567",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239750"}

@inproceedings{bb244845,
        AUTHOR = "Li, J.T. and Niu, L. and Zhang, L.Q.",
        TITLE = "From Representation to Reasoning: Towards both Evidence and
Commonsense Reasoning for Video Question-Answering",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "21241-21250",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239751"}

@inproceedings{bb244846,
        AUTHOR = "Datta, S. and Dharur, S. and Cartillier, V. and Desai, R. and Khanna, M. and Batra, D. and Parikh, D.",
        TITLE = "Episodic Memory Question Answering",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "19097-19106",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239752"}

@inproceedings{bb244847,
        AUTHOR = "Gandhi, M. and Gul, M.O. and Prakash, E. and Grunde McLaughlin, M. and Krishna, R. and Agrawala, M.",
        TITLE = "Measuring Compositional Consistency for Video Question Answering",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "5036-5045",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239753"}

@inproceedings{bb244848,
        AUTHOR = "Gorti, S.K. and Vouitsis, N. and Ma, J.W. and Golestan, K. and Volkovs, M. and Garg, A. and Yu, G.W.",
        TITLE = "X-Pool: Cross-Modal Language-Video Attention for Text-Video Retrieval",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "4996-5005",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239754"}

@inproceedings{bb244849,
        AUTHOR = "Li, J.C. and Tang, S.L. and Zhu, L.C. and Shi, H. and Huang, X.W. and Wu, F. and Yang, Y. and Zhuang, Y.T.",
        TITLE = "Adaptive Hierarchical Graph Reasoning with Semantic Coherence for
Video-and-Language Inference",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1847-1857",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239755"}

@inproceedings{bb244850,
        AUTHOR = "Zhang, M.X. and Yang, Y. and Chen, X. and Ji, Y.L. and Xu, X. and Li, J.J. and Shen, H.T.",
        TITLE = "Multi-stage Aggregated Transformer Network for Temporal Language
Localization in Videos",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "12664-12673",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239756"}

@inproceedings{bb244851,
        AUTHOR = "Kim, N. and Ha, S.J. and Kang, J.W.",
        TITLE = "Video Question Answering Using Language-Guided Deep Compressed-Domain
Video Feature",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1688-1697",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239757"}

@inproceedings{bb244852,
        AUTHOR = "Liu, F. and Liu, J. and Wang, W.N. and Lu, H.Q.",
        TITLE = "HAIR: Hierarchical Visual-Semantic Relational Reasoning for Video
Question Answering",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1678-1687",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239758"}

@inproceedings{bb244853,
        AUTHOR = "Gao, D.F. and Wang, R.P. and Bai, Z. and Chen, X.L.",
        TITLE = "Env-QA: A Video Question Answering Benchmark for Comprehensive
Understanding of Dynamic Environments",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1655-1665",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239759"}

@inproceedings{bb244854,
        AUTHOR = "Yun, H. and Yu, Y. and Yang, W. and Lee, K. and Kim, G.",
        TITLE = "Pano-AVQA: Grounded Audio-Visual Question Answering on 360° Videos",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "2011-2021",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239760"}

@inproceedings{bb244855,
        AUTHOR = "Xu, L. and Huang, H. and Liu, J.",
        TITLE = "SUTD-TrafficQA: A Question Answering Benchmark and an Efficient
Network for Video Reasoning over Traffic Events",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "9873-9883",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239761"}

@inproceedings{bb244856,
        AUTHOR = "Park, J. and Lee, J.Y. and Sohn, K.H.",
        TITLE = "Bridge to Answer: Structure-aware Graph Interaction Network for Video
Question Answering",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "15521-15530",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239762"}

@inproceedings{bb244857,
        AUTHOR = "Chen, X.W. and Liu, R. and Song, X.M. and Han, Y.H.",
        TITLE = "Locating Visual Explanations for Video Question Answering",
        BOOKTITLE = MMMod21,
        YEAR = "2021",
        PAGES = "I:290-302",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239763"}

@inproceedings{bb244858,
        AUTHOR = "Garcia, N. and Nakashima, Y.",
        TITLE = "Knowledge-based Video Question Answering with Unsupervised Scene
Descriptions",
        BOOKTITLE = ECCV20,
        YEAR = "2020",
        PAGES = "XVIII:581-598",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239764"}

@inproceedings{bb244859,
        AUTHOR = "Kim, J. and Ma, M. and Pham, T. and Kim, K. and Yoo, C.D.",
        TITLE = "Modality Shifting Attention Network for Multi-Modal Video Question
Answering",
        BOOKTITLE = CVPR20,
        YEAR = "2020",
        PAGES = "10103-10112",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239765"}

@inproceedings{bb244860,
        AUTHOR = "Jiang, M. and Chen, S. and Yang, J. and Zhao, Q.",
        TITLE = "Fantastic Answers and Where to Find Them: Immersive Question-Directed
Visual Attention",
        BOOKTITLE = CVPR20,
        YEAR = "2020",
        PAGES = "2977-2986",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239766"}

@inproceedings{bb244861,
        AUTHOR = "Yang, Z. and Garcia, N. and Chu, C. and Otani, M. and Nakashima, Y. and Takemura, H.",
        TITLE = "BERT Representations for Video Question Answering",
        BOOKTITLE = WACV20,
        YEAR = "2020",
        PAGES = "1545-1554",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239767"}

@inproceedings{bb244862,
        AUTHOR = "Fan, C.Y. and Zhang, X.F. and Zhang, S. and Wang, W.S. and Zhang, C. and Huang, H.",
        TITLE = "Heterogeneous Memory Enhanced Multimodal Attention Model for Video
Question Answering",
        BOOKTITLE = CVPR19,
        YEAR = "2019",
        PAGES = "1999-2007",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239768"}

@inproceedings{bb244863,
        AUTHOR = "Kim, J.Y. and Ma, M. and Kim, K. and Kim, S.J. and Yoo, C.D.",
        TITLE = "Progressive Attention Memory Network for Movie Story Question Answering",
        BOOKTITLE = CVPR19,
        YEAR = "2019",
        PAGES = "8329-8338",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239769"}

@inproceedings{bb244864,
        AUTHOR = "Liu, C.N. and Chen, D.J. and Chen, H.T. and Liu, T.L.",
        TITLE = "A2A: Attention to Attention Reasoning for Movie Question Answering",
        BOOKTITLE = ACCV18,
        YEAR = "2018",
        PAGES = "VI:404-419",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239770"}

@inproceedings{bb244865,
        AUTHOR = "Gao, J. and Ge, R. and Chen, K. and Nevatia, R.",
        TITLE = "Motion-Appearance Co-memory Networks for Video Question Answering",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "6576-6585",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239771"}

@inproceedings{bb244866,
        AUTHOR = "Kim, K.M. and Choi, S.H. and Kim, J.H. and Zhang, B.T.",
        TITLE = "Multimodal Dual Attention Memory for Video Story Question Answering",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "XV: 698-713",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239772"}

@inproceedings{bb244867,
        AUTHOR = "Yu, Y.J. and Kim, J.S. and Kim, G.",
        TITLE = "A Joint Sequence Fusion Model for Video Question Answering and
Retrieval",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "VII: 487-503",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239773"}

@inproceedings{bb244868,
        AUTHOR = "Hasan Chowdhury, M.I. and Nguyen, K. and Sridharan, S. and Fookes, C.",
        TITLE = "Hierarchical Relational Attention for Video Question Answering",
        BOOKTITLE = ICIP18,
        YEAR = "2018",
        PAGES = "599-603",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239774"}

@inproceedings{bb244869,
        AUTHOR = "Mun, J. and Seo, P.H. and Jung, I. and Han, B.H.",
        TITLE = "MarioQA: Answering Questions by Watching Gameplay Videos",
        BOOKTITLE = ICCV17,
        YEAR = "2017",
        PAGES = "2886-2894",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239775"}

@inproceedings{bb244870,
        AUTHOR = "Yu, Y. and Ko, H. and Choi, J. and Kim, G.",
        TITLE = "End-to-End Concept Word Detection for Video Captioning, Retrieval,
and Question Answering",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "3261-3269",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vidq2.html#TT239776"}

@article{bb244871,
        AUTHOR = "Kafle, K. and Kanan, C.",
        TITLE = "Visual question answering:
Datasets, algorithms, and future challenges",
        JOURNAL = CVIU,
        VOLUME = "163",
        YEAR = "2017",
        NUMBER = "1",
        PAGES = "3-20",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239779"}

@article{bb244872,
        AUTHOR = "Wu, Q. and Teney, D. and Wang, P. and Shen, C.H. and Dick, A. and van den Hengel, A.J.",
        TITLE = "Visual question answering: A survey of methods and datasets",
        JOURNAL = CVIU,
        VOLUME = "163",
        YEAR = "2017",
        NUMBER = "1",
        PAGES = "21-40",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239780"}

@article{bb244873,
        AUTHOR = "Teney, D. and Wu, Q. and van den Hengel, A.J.",
        TITLE = "Visual Question Answering: A Tutorial",
        JOURNAL = SPMag,
        VOLUME = "34",
        YEAR = "2017",
        NUMBER = "6",
        MONTH = "November",
        PAGES = "63-75",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239781"}

@inproceedings{bb244874,
        AUTHOR = "Teney, D. and Liu, L. and van den Hengel, A.J.",
        TITLE = "Graph-Structured Representations for Visual Question Answering",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "3233-3241",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239782"}

@inproceedings{bb244875,
        AUTHOR = "Teney, D. and van den Hengel, A.J.",
        TITLE = "Visual Question Answering as a Meta Learning Task",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "XV: 229-245",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239783"}

@inproceedings{bb244876,
        AUTHOR = "Teney, D. and Abbasnejad, E. and van den Hengel, A.J.",
        TITLE = "Unshuffling Data for Improved Generalization in Visual Question
Answering",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1397-1407",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239784"}

@article{bb244877,
        AUTHOR = "Wu, Q. and Shen, C.H. and Wang, P. and Dick, A. and van den Hengel, A.J.",
        TITLE = "Image Captioning and Visual Question Answering Based on Attributes
and External Knowledge",
        JOURNAL = PAMI,
        VOLUME = "40",
        YEAR = "2018",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "1367-1381",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239785"}

@inproceedings{bb244878,
        AUTHOR = "Wu, Q. and Wang, P. and Shen, C.H. and Dick, A. and van den Hengel, A.J.",
        TITLE = "Ask Me Anything: Free-Form Visual Question Answering Based on
Knowledge from External Sources",
        BOOKTITLE = CVPR16,
        YEAR = "2016",
        PAGES = "4622-4630",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239786"}

@article{bb244879,
        AUTHOR = "Tommasi, T. and Mallya, A. and Plummer, B.A. and Lazebnik, S. and Berg, A.C. and Berg, T.L.",
        TITLE = "Combining Multiple Cues for Visual Madlibs Question Answering",
        JOURNAL = IJCV,
        VOLUME = "127",
        YEAR = "2019",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "38-60",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239787"}

@inproceedings{bb244880,
        AUTHOR = "Tommasi, T. and Mallya, A. and Plummer, B.A. and Lazebnik, S. and Berg, A.C. and Berg, T.L.",
        TITLE = "Solving Visual Madlibs with Multiple Cues",
        BOOKTITLE = BMVC16,
        YEAR = "2016",
        PAGES = "xx-yy",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239788"}

@inproceedings{bb244881,
        AUTHOR = "Yu, L.C. and Park, E. and Berg, A.C. and Berg, T.L.",
        TITLE = "Visual Madlibs:
Fill in the Blank Description Generation and Question Answering",
        BOOKTITLE = ICCV15,
        YEAR = "2015",
        PAGES = "2461-2469",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239789"}

@article{bb244882,
        AUTHOR = "Liu, F. and Xiang, T. and Hospedales, T.M. and Yang, W.K. and Sun, C.Y.",
        TITLE = "Inverse Visual Question Answering:
A New Benchmark and VQA Diagnosis Tool",
        JOURNAL = PAMI,
        VOLUME = "42",
        YEAR = "2020",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "460-474",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239790"}

@inproceedings{bb244883,
        AUTHOR = "Liu, F. and Xiang, T. and Hospedales, T.M. and Yang, W.K. and Sun, C.Y.",
        TITLE = "iVQA: Inverse Visual Question Answering",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "8611-8619",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239791"}

@article{bb244884,
        AUTHOR = "Patil, C. and Patwardhan, M.",
        TITLE = "Visual Question Generation: The State of the Art",
        JOURNAL = Surveys,
        VOLUME = "53",
        YEAR = "2020",
        NUMBER = "3",
        MONTH = "May",
        PAGES = "xx-yy",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239792"}

@article{bb244885,
        AUTHOR = "He, F.J. and Wang, Y.X. and Miao, X.L. and Sun, X.",
        TITLE = "Interpretable visual reasoning: A survey",
        JOURNAL = IVC,
        VOLUME = "112",
        YEAR = "2021",
        PAGES = "104194",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239793"}

@article{bb244886,
        AUTHOR = "Sharma, H. and Jalal, A.S.",
        TITLE = "A survey of methods, datasets and evaluation metrics for visual
question answering",
        JOURNAL = IVC,
        VOLUME = "116",
        YEAR = "2021",
        PAGES = "104327",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239794"}

@article{bb244887,
        AUTHOR = "Yang, L. and Jiang, H. and Song, Q. and Guo, J.",
        TITLE = "A Survey on Long-Tailed Visual Recognition",
        JOURNAL = IJCV,
        VOLUME = "130",
        YEAR = "2022",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "1837-1872",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239795"}

@article{bb244888,
        AUTHOR = "Zhao, W.L. and Rao, Y.M. and Tang, Y.S. and Zhou, J. and Lu, J.W.",
        TITLE = "VideoABC: A Real-World Video Dataset for Abductive Visual Reasoning",
        JOURNAL = IP,
        VOLUME = "31",
        YEAR = "2022",
        PAGES = "6048-6061",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239796"}

@article{bb244889,
        AUTHOR = "Lahouti, F. and Kostina, V. and Hassibi, B.",
        TITLE = "How to Query an Oracle? Efficient Strategies to Label Data",
        JOURNAL = PAMI,
        VOLUME = "44",
        YEAR = "2022",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "7597-7609",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239797"}

@article{bb244890,
        AUTHOR = "Ma, J. and Wang, P.H. and Kong, D.C. and Wang, Z.W. and Liu, J. and Pei, H.B. and Zhao, J.Z.",
        TITLE = "Robust Visual Question Answering: Datasets, Methods, and Future
Challenges",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "5575-5594",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239798"}

@article{bb244891,
        AUTHOR = "Li, K. and Vosselman, G. and Yang, M.Y.",
        TITLE = "HRVQA: A Visual Question Answering benchmark for high-resolution
aerial images",
        JOURNAL = PandRS,
        VOLUME = "214",
        YEAR = "2024",
        PAGES = "65-81",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239799"}

@inproceedings{bb244892,
        AUTHOR = "Chen, C.Y. and Liu, M.C. and Codella, N. and Li, Y.S. and Yuan, L. and Gurari, D.",
        TITLE = "Fully Authentic Visual Question Answering Dataset from Online
Communities",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLVIII: 252-269",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239800"}

@inproceedings{bb244893,
        AUTHOR = "Singh, M. and Patvardhan, C. and Lakshmi, C.V.",
        TITLE = "Does ChatGPT Spell the End of Automatic Question Generation Research?",
        BOOKTITLE = ICCVMI23,
        YEAR = "2023",
        PAGES = "1-6",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239801"}

@inproceedings{bb244894,
        AUTHOR = "Zhu, L. and Ning, R. and Li, J. and Xin, C.S. and Wu, H.Y.",
        TITLE = "Most and Least Retrievable Images in Visual-Language Query Systems",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXVII:1-18",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239802"}

@inproceedings{bb244895,
        AUTHOR = "Salewski, L. and Emde, C. and Do, V. and Akata, Z. and Lukasiewicz, T.",
        TITLE = "e-ViL: A Dataset and Benchmark for Natural Language Explanations in
Vision-Language Tasks",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1224-1234",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239803"}

@inproceedings{bb244896,
        AUTHOR = "Gupta, V. and Patro, B.N. and Parihar, H. and Namboodiri, V.P.",
        TITLE = "VQuAD: Video Question Answering Diagnostic Dataset",
        BOOKTITLE = Novelty22,
        YEAR = "2022",
        PAGES = "282-291",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239804"}

@inproceedings{bb244897,
        AUTHOR = "Nishimura, T. and Sakoda, K. and Hashimoto, A. and Ushiku, Y. and Tanaka, N. and Ono, F. and Kameko, H. and Mori, S.",
        TITLE = "Egocentric Biochemical Video-and-Language Dataset",
        BOOKTITLE = CLVL21,
        YEAR = "2021",
        PAGES = "3122-3126",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239805"}

@inproceedings{bb244898,
        AUTHOR = "Zhang, M.D. and Maidment, T. and Diab, A. and Kovashka, A. and Hwa, R.",
        TITLE = "Domain-robust VQA with diverse datasets and methods but no target
labels",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "7042-7052",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239806"}

@inproceedings{bb244899,
        AUTHOR = "Mathew, M. and Karatzas, D. and Jawahar, C.V.",
        TITLE = "DocVQA: A Dataset for VQA on Document Images",
        BOOKTITLE = WACV21,
        YEAR = "2021",
        PAGES = "2199-2208",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqds43.html#TT239807"}

Last update:Aug 19, 2026 at 13:26:35