@inproceedings{bb243900,
AUTHOR = "Haisa, G. and Altenbek, G.",
TITLE = "Question Classification Based on Weak Supervision and Interrogative
Pronouns Attention Mechanism",
BOOKTITLE = "ICPR22",
YEAR = "2022",
PAGES = "2273-2278",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238808"}
@inproceedings{bb243901,
AUTHOR = "Nguyen, B.X. and Do, T. and Tran, H. and Tjiputra, E. and Tran, Q.D. and Nguyen, A.",
TITLE = "Coarse-to-Fine Reasoning for Visual Question Answering",
BOOKTITLE = MULA22,
YEAR = "2022",
PAGES = "4557-4565",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238809"}
@inproceedings{bb243902,
AUTHOR = "Liang, Y.Y. and Wang, X. and Duan, X.G. and Zhu, W.W.",
TITLE = "Multi-modal Contextual Graph Neural Network for Text Visual Question
Answering",
BOOKTITLE = ICPR21,
YEAR = "2021",
PAGES = "3491-3498",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238810"}
@inproceedings{bb243903,
AUTHOR = "Patro, B.N. and Kurmi, V.K. and Kumar, S. and Namboodiri, V.P.",
TITLE = "Deep Bayesian Network for Visual Question Generation",
BOOKTITLE = WACV20,
YEAR = "2020",
PAGES = "1555-1565",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238811"}
@inproceedings{bb243904,
AUTHOR = "Singh, A.K. and Mishra, A. and Shekhar, S. and Chakraborty, A.",
TITLE = "From Strings to Things: Knowledge-Enabled VQA Model That Can Read and
Reason",
BOOKTITLE = ICCV19,
YEAR = "2019",
PAGES = "4601-4611",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238812"}
@inproceedings{bb243905,
AUTHOR = "Wilf, A. and Ma, M.Q. and Liang, P.P. and Zadeh, A. and Morency, L.P.",
TITLE = "Face-to-Face Contrastive Learning for Social Intelligence
Question-Answering",
BOOKTITLE = FG23,
YEAR = "2023",
PAGES = "1-7",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238813"}
@inproceedings{bb243906,
AUTHOR = "Zadeh, A. and Chan, M. and Liang, P.P. and Tong, E. and Morency, L.P.",
TITLE = "Social-IQ: A Question Answering Benchmark for Artificial Social
Intelligence",
BOOKTITLE = CVPR19,
YEAR = "2019",
PAGES = "8799-8809",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238814"}
@inproceedings{bb243907,
AUTHOR = "Ma, C. and Shen, C. and Dick, A. and Wu, Q. and Wang, P. and van den Hengel, A.J. and Reid, I.D.",
TITLE = "Visual Question Answering with Memory-Augmented Networks",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "6975-6984",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238815"}
@inproceedings{bb243908,
AUTHOR = "Shin, A. and Ushiku, Y. and Harada, T.",
TITLE = "Customized Image Narrative Generation via Interactive Visual Question
Generation and Answering",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "8925-8933",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238816"}
@inproceedings{bb243909,
AUTHOR = "Teney, D. and Anderson, P. and He, X. and van den Hengel, A.J.",
TITLE = "Tips and Tricks for Visual Question Answering:
Learnings from the 2017 Challenge",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "4223-4232",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238817"}
@inproceedings{bb243910,
AUTHOR = "Bai, Y.L. and Fu, J.L. and Zhao, T.J. and Mei, T.",
TITLE = "Deep Attention Neural Tensor Network for Visual Question Answering",
BOOKTITLE = ECCV18,
YEAR = "2018",
PAGES = "XII: 21-37",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238818"}
@inproceedings{bb243911,
AUTHOR = "Sinha, A. and Ayush, K.",
TITLE = "Towards Mathematical Reasoning: A Multimodal Deep Learning Approach",
BOOKTITLE = ICIP18,
YEAR = "2018",
PAGES = "4028-4032",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238819"}
@inproceedings{bb243912,
AUTHOR = "Rosso Mateus, A. and Gonzalez, F.A. and Montes y Gomez, M.",
TITLE = "A Two-Step Neural Network Approach to Passage Retrieval for Open Domain
Question Answering",
BOOKTITLE = CIARP17,
YEAR = "2017",
PAGES = "566-574",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238820"}
@inproceedings{bb243913,
AUTHOR = "Zhu, C. and Zhao, Y. and Huang, S. and Tu, K. and Ma, Y.",
TITLE = "Structured Attentions for Visual Question Answering",
BOOKTITLE = ICCV17,
YEAR = "2017",
PAGES = "1300-1309",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238821"}
@inproceedings{bb243914,
AUTHOR = "Hu, R. and Andreas, J. and Rohrbach, M. and Darrell, T.J. and Saenko, K.",
TITLE = "Learning to Reason:
End-to-End Module Networks for Visual Question Answering",
BOOKTITLE = ICCV17,
YEAR = "2017",
PAGES = "804-813",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238822"}
@inproceedings{bb243915,
AUTHOR = "Peris, A. and Casacuberta, F.",
TITLE = "Interactive-Predictive Neural Multimodal Systems",
BOOKTITLE = IbPRIA19,
YEAR = "2019",
PAGES = "I:16-28",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238823"}
@inproceedings{bb243916,
AUTHOR = "Bolanos, M. and Peris, A. and Casacuberta, F. and Radeva, P.",
TITLE = "VIBIKNet: Visual Bidirectional Kernelized Network for Visual Question
Answering",
BOOKTITLE = IbPRIA17,
YEAR = "2017",
PAGES = "372-380",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238824"}
@inproceedings{bb243917,
AUTHOR = "Kafle, K. and Kanan, C.",
TITLE = "An Analysis of Visual Question Answering Algorithms",
BOOKTITLE = ICCV17,
YEAR = "2017",
PAGES = "1983-1991",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238825"}
@inproceedings{bb243918,
AUTHOR = "Kafle, K. and Kanan, C.",
TITLE = "Answer-Type Prediction for Visual Question Answering",
BOOKTITLE = CVPR16,
YEAR = "2016",
PAGES = "4976-4984",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238826"}
@inproceedings{bb243919,
AUTHOR = "Wang, P. and Wu, Q. and Shen, C. and van den Hengel, A.J.",
TITLE = "The VQA-Machine: Learning How to Use Existing Vision Algorithms to
Answer New Questions",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "3909-3918",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238827"}
@inproceedings{bb243920,
AUTHOR = "Yu, D. and Fu, J. and Mei, T. and Rui, Y.",
TITLE = "Multi-level Attention Networks for Visual Question Answering",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "4187-4195",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238828"}
@inproceedings{bb243921,
AUTHOR = "Ramakrishnan, S.K. and Pal, A. and Sharma, G. and Mittal, A.",
TITLE = "An Empirical Evaluation of Visual Question Answering for Novel
Objects",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "7312-7321",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vqann4.html#TT238829"}
@article{bb243922,
AUTHOR = "Gouthaman, K.V. and Nambiar, A. and Srinivas, K.S. and Mittal, A.",
TITLE = "Linguistically-aware attention for reducing the semantic gap in
vision-language tasks",
JOURNAL = PR,
VOLUME = "112",
YEAR = "2021",
PAGES = "107812",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238830"}
@article{bb243923,
AUTHOR = "Zhou, K.Y. and Yang, J.K. and Loy, C.C. and Liu, Z.W.",
TITLE = "Learning to Prompt for Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "130",
YEAR = "2022",
NUMBER = "9",
MONTH = "September",
PAGES = "2337-2348",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238831"}
@inproceedings{bb243924,
AUTHOR = "Zhou, K.Y. and Yang, J.K. and Loy, C.C. and Liu, Z.W.",
TITLE = "Conditional Prompt Learning for Vision-Language Models",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "16795-16804",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238832"}
@article{bb243925,
AUTHOR = "Ma, C.C. and Liu, Y. and Deng, J.K. and Xie, L.X. and Dong, W.M. and Xu, C.S.",
TITLE = "Understanding and Mitigating Overfitting in Prompt Tuning for
Vision-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "33",
YEAR = "2023",
NUMBER = "9",
MONTH = "September",
PAGES = "4616-4629",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238833"}
@article{bb243926,
AUTHOR = "Chen, C.Q. and Han, D.Z. and Chang, C.C.",
TITLE = "MPCCT: Multimodal vision-language learning paradigm with
context-based compact Transformer",
JOURNAL = PR,
VOLUME = "147",
YEAR = "2024",
PAGES = "110084",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238834"}
@article{bb243927,
AUTHOR = "Yu, Z.T. and Zhao, J. and Guo, C.L. and Yang, Y.",
TITLE = "StableNet: Distinguishing the hard samples to overcome language
priors in visual question answering",
JOURNAL = IET-CV,
VOLUME = "18",
YEAR = "2024",
NUMBER = "2",
PAGES = "315-327",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238835"}
@article{bb243928,
AUTHOR = "Bazi, Y. and Bashmal, L. and Rahhal, M.M.A. and Ricci, R. and Melgani, F.",
TITLE = "RS-LLaVA: A Large Vision-Language Model for Joint Captioning and
Question Answering in Remote Sensing Imagery",
JOURNAL = RS,
VOLUME = "16",
YEAR = "2024",
NUMBER = "9",
PAGES = "1477",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238836"}
@article{bb243929,
AUTHOR = "Tan, Y.T. and Chen, Y.Y. and Wang, J.Q.",
TITLE = "DSTA: Reinforcing Vision-Language Understanding for Scene-Text VQA
With Dual-Stream Training Approach",
JOURNAL = SPLetters,
VOLUME = "32",
YEAR = "2025",
PAGES = "6-10",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238837"}
@article{bb243930,
AUTHOR = "Alsabbagh, A.R. and Mansour, T. and Al Kharabsheh, M. and Ebdah, A.S. and Al Emaryeen, R. and Al Nahhas, S. and Mahafza, W. and Al Kadi, O.",
TITLE = "MiniMedGPT: Efficient Large Vision-Language Model for medical Visual
Question Answering",
JOURNAL = PRL,
VOLUME = "189",
YEAR = "2025",
PAGES = "8-16",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238838"}
@article{bb243931,
AUTHOR = "Wang, X. and Wu, J.L. and Lin, Z. and Zhang, F.Z. and Zhang, D. and Nie, L.Q.",
TITLE = "Video DataFlywheel: Resolving the Impossible Data Trinity in
Video-Language Understanding",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "4",
MONTH = "April",
PAGES = "2912-2923",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238839"}
@article{bb243932,
AUTHOR = "Shen, R. and Inoue, N. and Guan, D. and Cai, R. and Kot, A.C. and Shinoda, K.",
TITLE = "ContextualCoder: Adaptive In-Context Prompting for Programmatic
Visual Question Answering",
JOURNAL = MultMed,
VOLUME = "27",
YEAR = "2025",
PAGES = "4936-4949",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238840"}
@inproceedings{bb243933,
AUTHOR = "Shen, R. and Inoue, N. and Shinoda, K.",
TITLE = "Pyramid Coder: Hierarchical Code Generator for Compositional Visual
Question Answering",
BOOKTITLE = ICIP24,
YEAR = "2024",
PAGES = "430-436",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238841"}
@article{bb243934,
AUTHOR = "Zhang, Y.J. and Liu, H.L. and Kim, Y. and Hong, S.",
TITLE = "CAT-TPT: Class-Agnostic Text-based Test-time Prompt Tuning for
Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "10",
MONTH = "October",
PAGES = "6930-6952",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238842"}
@article{bb243935,
AUTHOR = "Liu, F.Y. and Hu, Z.J. and Yang, P. and Liu, X.Y.",
TITLE = "Iterative Caption Generation with Heuristic Guidance for enhancing
knowledge-based visual question answering",
JOURNAL = CVIU,
VOLUME = "261",
YEAR = "2025",
PAGES = "104515",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238843"}
@article{bb243936,
AUTHOR = "Jiang, P.C. and Ibrayim, M. and Shen, S.",
TITLE = "TCaEx: Targeted Caption as External Knowledge for knowledge-based
visual question answering",
JOURNAL = IVC,
VOLUME = "163",
YEAR = "2025",
PAGES = "105772",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238844"}
@article{bb243937,
AUTHOR = "Zhang, J. and Wu, S.H. and Gao, L.L. and Song, J.K. and Sebe, N. and Shen, H.T.",
TITLE = "A Closer Look at Conditional Prompt Tuning for Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "194",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238845"}
@article{bb243938,
AUTHOR = "Shen, X.Q. and Wang, F. and Yang, Z. and Wang, B. and Du, W.L. and Zong, C.Q. and Xia, R.",
TITLE = "Reason-Align-Respond: Aligning LLM Reasoning With Knowledge Graphs
for KGQA",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "7",
MONTH = "July",
PAGES = "7340-7353",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238846"}
@article{bb243939,
AUTHOR = "Wang, F.J. and Wang, Z.X. and An, G.Y. and Lang, C.Y. and Wu, D.P.O.",
TITLE = "SHC: Deeply Activating Human-Like Cognitive Ability for Visual
Question Answering",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "7",
MONTH = "July",
PAGES = "8503-8519",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238847"}
@article{bb243940,
AUTHOR = "Gu, X. and Li, Y. and Zhu, B. and Wang, J.Q. and Qin, X.L.",
TITLE = "DICE: Disentangling Causal Evidence for multimodal textbook question
answering via attentive embedding fusion",
JOURNAL = PR,
VOLUME = "179",
YEAR = "2026",
PAGES = "113953",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238848"}
@inproceedings{bb243941,
AUTHOR = "Panagopoulou, A. and Zhou, H.L. and Savarese, S. and Xiong, C.M. and Callison Burch, C. and Yatskar, M. and Niebles, J.C.",
TITLE = "ViUniT: Visual Unit Tests for More Robust Visual Programming",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "24646-24656",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238849"}
@inproceedings{bb243942,
AUTHOR = "Wang, W.Z. and Duan, C. and Peng, Z.H. and Liu, Y.X. and Zhou, B.",
TITLE = "Embodied Scene Understanding for Vision Language Models via MetaVQA",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "22453-22464",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238850"}
@inproceedings{bb243943,
AUTHOR = "Tian, X.Y. and Zou, S. and Yang, Z.Y. and Zhang, J.",
TITLE = "Identifying and Mitigating Position Bias of Multi-image
Vision-Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "10599-10609",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238851"}
@inproceedings{bb243944,
AUTHOR = "Sheng, L.J. and Liang, J. and Wang, Z. and He, R.",
TITLE = "R-TPT: Improving Adversarial Robustness of Vision-Language Models
through Test-Time Prompt Tuning",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "29958-29967",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238852"}
@inproceedings{bb243945,
AUTHOR = "Das, D. and Talon, D. and Mancini, M. and Wang, Y.M. and Ricci, E.",
TITLE = "One VLM to Keep it Learning: Generation and Balancing for Data-free
Continual Visual Question Answering",
BOOKTITLE = WACV25,
YEAR = "2025",
PAGES = "5635-5645",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238853"}
@inproceedings{bb243946,
AUTHOR = "Ishmam, M.F. and Tashdeed, I. and Saadat, T.A. and Ashmafee, M.H. and Kamal, A.R.M. and Hossain, M.A.",
TITLE = "Visual Robustness Benchmark for Visual Question Answering (VQA)",
BOOKTITLE = WACV25,
YEAR = "2025",
PAGES = "6623-6633",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238854"}
@inproceedings{bb243947,
AUTHOR = "Chen, X. and Djolonga, J. and Padlewski, P. and Mustafa, B. and Changpinyo, S. and Wu, J.L. and Ruiz, C.R. and Goodman, S. and Wang, X. and Tay, Y. and Shakeri, S. and Dehghani, M. and Salz, D. and Lucic, M. and Tschannen, M. and Nagrani, A. and Hu, H. and Joshi, M. and Pang, B. and Montgomery, C. and Pietrzyk, P. and Ritter, M. and Piergiovanni, A. and Minderer, M. and Pavetic, F. and Waters, A. and Li, G. and Alabdulmohsin, I. and Beyer, L. and Amelot, J. and Lee, K. and Steiner, A.P. and Li, Y. and Keysers, D. and Arnab, A. and Xu, Y.Z. and Rong, K. and Kolesnikov, A. and Seyedhosseini, M. and Angelova, A. and Zhai, X.H. and Houlsby, N. and Soricut, R.",
TITLE = "On Scaling Up a Multilingual Vision and Language Model",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "14432-14444",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238855"}
@inproceedings{bb243948,
AUTHOR = "Li, R.J. and Wu, Y. and He, X.M.",
TITLE = "Learning by Correction: Efficient Tuning Task for Zero-Shot
Generative Vision-Language Reasoning",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "13428-13437",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238856"}
@inproceedings{bb243949,
AUTHOR = "Khan, Z. and Fu, Y.",
TITLE = "Consistency and Uncertainty: Identifying Unreliable Responses From
Black-Box Vision-Language Models for Selective Visual Question
Answering",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "10854-10863",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238857"}
@inproceedings{bb243950,
AUTHOR = "Gu, T.C. and Yang, K.C. and Liu, D. and Cai, W.D.",
TITLE = "LaPA: Latent Prompt Assist Model for Medical Visual Question
Answering",
BOOKTITLE = DEF-AI-MIA24,
YEAR = "2024",
PAGES = "4971-4980",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238858"}
@inproceedings{bb243951,
AUTHOR = "Feinglass, J. and Yang, Y.Z.",
TITLE = "Towards Addressing the Misalignment of Object Proposal Evaluation for
Vision-Language Tasks via Semantic Grounding",
BOOKTITLE = WACV24,
YEAR = "2024",
PAGES = "4385-4395",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238859"}
@inproceedings{bb243952,
AUTHOR = "Nadeem, A. and Hilton, A. and Dawes, R. and Thomas, G. and Mustafa, A.",
TITLE = "CAD: Contextual Multi-modal Alignment for Dynamic AVQA",
BOOKTITLE = WACV24,
YEAR = "2024",
PAGES = "7236-7248",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238860"}
@inproceedings{bb243953,
AUTHOR = "Wu, W. and Li, Q. and Zhong, W.L. and Huang, J.Z.",
TITLE = "MIVC: Multiple Instance Visual Component for Visual-Language Models",
BOOKTITLE = WACV24,
YEAR = "2024",
PAGES = "8102-8111",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238861"}
@inproceedings{bb243954,
AUTHOR = "Walmer, M. and Sikka, K. and Sur, I. and Shrivastava, A. and Jha, S.",
TITLE = "Dual-Key Multimodal Backdoors for Visual Question Answering",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "15354-15364",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238862"}
@inproceedings{bb243955,
AUTHOR = "Ding, Y. and Yu, J. and Liu, B. and Hu, Y. and Cui, M.X. and Wu, Q.",
TITLE = "MuKEA: Multimodal Knowledge Extraction and Accumulation for
Knowledge-based Visual Question Answering",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "5079-5088",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238863"}
@inproceedings{bb243956,
AUTHOR = "Gao, F. and Ping, Q. and Thattai, G. and Reganti, A. and Wu, Y.N. and Natarajan, P.",
TITLE = "Transform-Retrieve-Generate: Natural Language-Centric
Outside-Knowledge Visual Question Answering",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "5057-5067",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238864"}
@inproceedings{bb243957,
AUTHOR = "Aflalo, E. and Du, M. and Tseng, S.Y. and Liu, Y.F. and Wu, C. and Duan, N. and Lal, V.",
TITLE = "VL-InterpreT: An Interactive Visualization Tool for Interpreting
Vision-Language Transformers",
BOOKTITLE = CVPR22,
YEAR = "2022",
PAGES = "21374-21383",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238865"}
@inproceedings{bb243958,
AUTHOR = "Jain, V. and Lodhavia, J.",
TITLE = "Automatic Question Tagging using k-Nearest Neighbors and Random
Forest",
BOOKTITLE = ISCV20,
YEAR = "2020",
PAGES = "1-4",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlmvqa4.html#TT238866"}
@article{bb243959,
AUTHOR = "Ye, Q. and Yu, Z.T. and Shao, R. and Cui, Y.W. and Kang, X. and Liu, X. and Torr, P. and Cao, X.C.",
TITLE = "CAT+: Investigating and Enhancing Audio-Visual Understanding in Large
Language Models",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "10",
MONTH = "October",
PAGES = "8674-8690",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238867"}
@article{bb243960,
AUTHOR = "Li, S.S. and Xu, X. and Meng, W.X. and Song, J.K. and Peng, C. and Shen, H.T.",
TITLE = "Mitigating Hallucinations in Large Vision-Language Models via
Reasoning Uncertainty-Guided Refinement",
JOURNAL = MultMed,
VOLUME = "27",
YEAR = "2025",
PAGES = "7380-7391",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238868"}
@article{bb243961,
AUTHOR = "Fan, J.Q. and Wu, J.H. and Chu, H.Q. and Ge, Q.B. and Gao, B.Z.",
TITLE = "Hallucination Elimination and Text Annotation Framework for Large
Vision-Language Models in Traffic Scenarios",
JOURNAL = ITS,
VOLUME = "27",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "358-374",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238869"}
@article{bb243962,
AUTHOR = "Tu, C.J. and Ye, P. and Zhou, D.Z. and Bai, L. and Yu, G. and Chen, T. and Ouyang, W.L.",
TITLE = "Attention Reallocation: Towards Zero-cost and Controllable
Hallucination Mitigation of MLLMs",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "22",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238870"}
@article{bb243963,
AUTHOR = "Betti, F. and Baraldi, L. and Baraldi, L. and Cucchiara, R. and Sebe, N.",
TITLE = "Hallucination Early Detection in Diffusion Models",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "35",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238871"}
@article{bb243964,
AUTHOR = "Sun, Y. and Min, X.K. and Zhang, Z.C. and Gao, Y.X. and Cao, Y.Q. and Zhai, G.T.",
TITLE = "Mitigating Low-Level Visual Hallucinations Requires Self-Awareness:
Database, Model, and Training Strategy",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "3",
MONTH = "March",
PAGES = "3382-3396",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238872"}
@article{bb243965,
AUTHOR = "Wang, Y. and Zhou, J.C. and Liu, Q. and Hu, F. and Wang, G.",
TITLE = "Visual Evidence-Aware for Object Hallucinations Rectification in
LLM-Based Video Captioning",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "3",
MONTH = "March",
PAGES = "2842-2853",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238873"}
@article{bb243966,
AUTHOR = "Bi, C. and Dang, T.T. and Wang, S.H. and Cao, F. and Huang, Q.M.",
TITLE = "Asking Questions to Alleviate Object Hallucination in Large
Vision-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "3",
MONTH = "March",
PAGES = "3497-3512",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238874"}
@article{bb243967,
AUTHOR = "Yue, F. and Zhang, Y. and Liu, Y.W. and Yu, Y.",
TITLE = "Sarah: Hallucination detection for large vision language models with
semantic information locator and purifier in uncertainty
quantification method",
JOURNAL = IVC,
VOLUME = "168",
YEAR = "2026",
PAGES = "105938",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238875"}
@article{bb243968,
AUTHOR = "Chen, K. and Zhang, J. and Yang, J.Z. and Song, M.L. and Feng, Z.L.",
TITLE = "Self-improved holistic alignment for preference enhancement",
JOURNAL = PR,
VOLUME = "176",
YEAR = "2026",
PAGES = "113238",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238876"}
@article{bb243969,
AUTHOR = "Qiang, P.P. and Tan, H.Y. and Zhang, H. and Li, X.L. and Li, R. and Liang, J.",
TITLE = "Mitigating Hallucinations in Large Vision-Language Models via
Visual-Enhanced Contrastive Decoding",
JOURNAL = MultMed,
VOLUME = "28",
YEAR = "2026",
PAGES = "3242-3255",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238877"}
@article{bb243970,
AUTHOR = "Wu, M.R. and Li, J. and Ji, J.Y. and Hao, F. and Sun, X.S. and Ji, R.R.",
TITLE = "Evaluating and Mitigating Relationship Hallucinations in Large
Vision-Language Models",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "6",
MONTH = "June",
PAGES = "6332-6346",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238878"}
@article{bb243971,
AUTHOR = "Luo, M. and Wu, S.Q. and Jing, L.Q. and Ju, T.J. and Zheng, L. and Lai, J.X. and Wu, T.L. and Du, X.Y. and Li, J. and Yan, S.Y. and Luo, J.B. and Wang, W.Y. and Fei, H. and Lee, M.L. and Hsu, W.",
TITLE = "Dr.V: A Hierarchical Perception-Temporal-Cognition Framework to
Diagnose Video Hallucination by Fine-Grained Spatial-Temporal Grounding",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "6",
MONTH = "June",
PAGES = "278",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238879"}
@article{bb243972,
AUTHOR = "Lv, J.X. and Li, Z.J. and Gan, J. and Ren, W.Q. and Chen, S.Y. and Wang, J.",
TITLE = "Dual-strategy retrieval-augmented generation for anomaly recovery in
large language models",
JOURNAL = PR,
VOLUME = "178",
YEAR = "2026",
PAGES = "113430",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238880"}
@article{bb243973,
AUTHOR = "Xu, N. and Lu, Z. and Tian, H. and Zheng, B. and Cao, J. and Liu, A.A.",
TITLE = "MMToT: Multi-Modal Token-of-Thought Reasoning for Large Models",
JOURNAL = MultMed,
VOLUME = "28",
YEAR = "2026",
PAGES = "4460-4474",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238881"}
@article{bb243974,
AUTHOR = "Ho, Z.Y. and Liang, S.Y. and Tao, D.C.",
TITLE = "Understanding Hallucinations in Large Visual and Language Models",
JOURNAL = Surveys,
VOLUME = "58",
YEAR = "2026",
NUMBER = "13",
MONTH = "June",
PAGES = "xx-yy",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238882"}
@inproceedings{bb243975,
AUTHOR = "Zhu, L. and Ji, D. and Chen, T.R. and Xu, P. and Ye, J.P. and Liu, J.",
TITLE = "IBD: Alleviating Hallucinations in Large Vision-Language Models via
Image-Biased Decoding",
BOOKTITLE = TrustworthyOpen25,
YEAR = "2025",
PAGES = "1615-1624",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238883"}
@inproceedings{bb243976,
AUTHOR = "Li, Z.X. and Wu, X. and Du, H.Y. and Liu, F. and Nghiem, H. and Shi, G.Y.",
TITLE = "A Survey of State of the Art Large Vision Language Models: Alignment,
Benchmark, Evaluations and Challenges",
BOOKTITLE = TrustworthyOpen25,
YEAR = "2025",
PAGES = "1578-1597",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238884"}
@inproceedings{bb243977,
AUTHOR = "Tran, H.T. and Truong, T.D. and Luu, K.",
TITLE = "BIMA: Bijective Maximum Likelihood Learning Approach to Hallucination
Prediction and Mitigation in Large Vision-Language Models",
BOOKTITLE = Precognition25,
YEAR = "2025",
PAGES = "5302-5311",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238885"}
@inproceedings{bb243978,
AUTHOR = "Yu, T.Y. and Zhang, H. and Li, Q.M. and Xu, Q.X. and Yao, Y. and Chen, D. and Lu, X.M. and Cui, G. and Dang, Y.K. and He, T. and Feng, X.C. and Song, J. and Zheng, B. and Liu, Z.Y. and Chua, T.S. and Sun, M.S.",
TITLE = "RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V
Trustworthiness",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "19985-19995",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238886"}
@inproceedings{bb243979,
AUTHOR = "Liang, J. and Huang, W.K. and Wan, G.C. and Yang, Q. and Ye, M.",
TITLE = "LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized
Knowledge in Multimodal Large Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "26170-26180",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238887"}
@inproceedings{bb243980,
AUTHOR = "Wang, Y.B. and Guan, J. and Liang, J. and He, R.",
TITLE = "Do We Really Need Curated Malicious Data for Safety Alignment in
Multi-modal Large Language Models?",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "19879-19889",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238888"}
@inproceedings{bb243981,
AUTHOR = "Peng, R. and He, H.Y. and Wei, Y. and Wen, Y.D. and Hu, D.",
TITLE = "Matters: Training-free Fine-grained Image Caption Enhancement via
Local Perception",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "3963-3973",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238889"}
@inproceedings{bb243982,
AUTHOR = "Yang, Z. and Luo, X. and Han, D.Q. and Xu, Y.J. and Li, D.S.",
TITLE = "Mitigating Hallucinations in Large Vision-Language Models via DPO:
On-Policy Data Hold the Key",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "10610-10620",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238890"}
@inproceedings{bb243983,
AUTHOR = "Bae, K. and Kim, J. and Lee, S. and Lee, S. and Lee, G. and Choi, J.",
TITLE = "MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through
Disentangled Spatial-Temporal Representations",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "13744-13753",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238891"}
@inproceedings{bb243984,
AUTHOR = "Yin, H. and Si, G.Z. and Wang, Z.",
TITLE = "ClearSight: Visual Signal Enhancement for Object Hallucination
Mitigation in Multimodal Large Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "14625-14634",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238892"}
@inproceedings{bb243985,
AUTHOR = "Yang, L. and Zheng, Z.W. and Chen, B. and Zhao, Z.Y. and Lin, C.H. and Shen, C.",
TITLE = "Nullu: Mitigating Object Hallucinations in Large Vision-Language
Models via HalluSpace Projection",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "14635-14645",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238893"}
@inproceedings{bb243986,
AUTHOR = "Wu, Y.C. and Zhang, L. and Yao, H. and Du, J.L. and Yan, K. and Ding, S.H. and Wu, Y.S. and Li, X.Q.",
TITLE = "Antidote: A Unified Framework for Mitigating LVLM Hallucinations in
Counterfactual Presupposition and Object Perception",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "14646-14656",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238894"}
@inproceedings{bb243987,
AUTHOR = "Tu, Y. and Hu, R. and Sang, J.",
TITLE = "ODE: Open-Set Evaluation of Hallucinations in Multimodal Large
Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "19836-19845",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238895"}
@inproceedings{bb243988,
AUTHOR = "Liu, J.Z. and Fu, Y.H. and Xie, R. and Xie, R. and Sun, X. and Lian, F.Z. and Kang, Z. and Li, X.R.",
TITLE = "PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "19857-19866",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238896"}
@inproceedings{bb243989,
AUTHOR = "Jiang, Z.Q. and Chen, J.K. and Zhu, B. and Luo, T.J. and Shen, Y.K. and Yang, X.",
TITLE = "Devils in Middle Layers of Large Vision-Language Models:
Interpreting, Detecting and Mitigating Object Hallucinations via
Attention Lens",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "25004-25014",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238897"}
@inproceedings{bb243990,
AUTHOR = "Park, E. and Kim, M. and Kim, G.",
TITLE = "HalLoc: Token-level Localization of Hallucinations for Vision
Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "29893-29903",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238898"}
@inproceedings{bb243991,
AUTHOR = "Suo, W. and Zhang, L.J. and Sun, M.Y. and Wu, L.Y.B. and Wang, P. and Zhang, Y.N.",
TITLE = "Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "29904-29914",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238899"}
@inproceedings{bb243992,
AUTHOR = "An, W.B. and Tian, F. and Leng, S. and Nie, J.H. and Lin, H.N. and Wang, Q.Y. and Chen, P. and Zhang, X.Q. and Lu, S.J.",
TITLE = "Mitigating Object Hallucinations in Large Vision-Language Models with
Assembly of Global and Local Attention",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "29915-29926",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238900"}
@inproceedings{bb243993,
AUTHOR = "Zhuang, X.W. and Zhu, Z.H. and Xie, Y.X. and Liang, L.M. and Zou, Y.X.",
TITLE = "VASparse: Towards Efficient Visual Hallucination Mitigation via
Visual-Aware Token Sparsification",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "4189-4199",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238901"}
@inproceedings{bb243994,
AUTHOR = "Basak, D. and Bhatt, S. and Kanduri, S. and Desarkar, M.S.",
TITLE = "Aerial Mirage: Unmasking Hallucinations in Large Vision Language
Models",
BOOKTITLE = WACV25,
YEAR = "2025",
PAGES = "5500-5508",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238902"}
@inproceedings{bb243995,
AUTHOR = "Tang, F.L. and Liu, C.Z. and Xu, Z.X. and Hu, M. and Huang, Z. and Xue, H.C. and Chen, Z.Y. and Peng, Z.L. and Yang, Z.W. and Zhou, S.J. and Li, W.X. and Li, Y.L. and Song, W.X. and Su, S.Y. and Feng, W. and Su, J.L. and Lin, M. and Peng, Y.F. and Cheng, X.L. and Razzak, I. and Ge, Z.Y.",
TITLE = "Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with
Attention Causal Decoding",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "26147-26159",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238903"}
@inproceedings{bb243996,
AUTHOR = "Yang, J.N. and Chen, X. and Madaan, N. and Iyengar, M. and Qian, S. and Fouhey, D.F. and Chai, J.",
TITLE = "3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding
and Less Hallucination",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "29501-29512",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238904"}
@inproceedings{bb243997,
AUTHOR = "Yoon, D. and Song, Y. and Park, W.",
TITLE = "Stop learning it all to mitigate visual hallucination, Focus on the
hallucination target",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "4200-4208",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238905"}
@inproceedings{bb243998,
AUTHOR = "Chen, J.Z. and Zhang, T.S. and Huang, S.Y. and Niu, Y.W. and Zhang, L.F. and Wen, L.J. and Hu, X.M.",
TITLE = "ICT: Image-Object Cross-Level Trusted Intervention for Mitigating
Object Hallucination in Large Vision-Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "4209-4221",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238906"}
@inproceedings{bb243999,
AUTHOR = "Huang, P.H. and Li, J.L. and Chen, C.P. and Chang, M.C. and Chen, W.C.",
TITLE = "Who Brings the Frisbee: Probing Hidden Hallucination Factors in Large
Vision-Language Model via Causality Analysis",
BOOKTITLE = WACV25,
YEAR = "2025",
PAGES = "6125-6135",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803hallum4.html#TT238907"}
Last update:Jul 24, 2026 at 15:25:55