@inproceedings{bb247100,
        AUTHOR = "Zhang, H.Y. and Li, Y.M. and Zhang, Z.F.",
        TITLE = "Video-Grounded Dialogues with Joint Video and Image Training",
        BOOKTITLE = ICIP22,
        YEAR = "2022",
        PAGES = "3903-3907",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT241994"}

@inproceedings{bb247101,
        AUTHOR = "Zhang, S.Y. and Jiang, X.Z. and Yang, Z.Q. and Wan, T. and Qin, Z.C.",
        TITLE = "Reasoning with Multi-Structure Commonsense Knowledge in Visual Dialog",
        BOOKTITLE = MULA22,
        YEAR = "2022",
        PAGES = "4599-4608",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT241995"}

@inproceedings{bb247102,
        AUTHOR = "Zhu, Y. and Weng, Y. and Zhu, F.D. and Liang, X.D. and Ye, Q.X. and Lu, Y.T. and Jiao, J.B.",
        TITLE = "Self-Motivated Communication Agent for Real-World Vision-Dialog
Navigation",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1574-1583",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT241996"}

@inproceedings{bb247103,
        AUTHOR = "Engin, D. and Schnitzler, F. and Duong, N.Q.K. and Avrithis, Y.",
        TITLE = "On the hidden treasure of dialog in video question answering",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "2044-2053",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT241997"}

@inproceedings{bb247104,
        AUTHOR = "Matsumori, S. and Shingyouchi, K. and Abe, Y. and Fukuchi, Y. and Sugiura, K. and Imai, M.",
        TITLE = "Unified Questioner Transformer for Descriptive Question Generation in
Goal-Oriented Visual Dialogue",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1878-1887",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT241998"}

@inproceedings{bb247105,
        AUTHOR = "Tu, T. and Ping, Q. and Thattai, G. and Tur, G. and Natarajan, P.",
        TITLE = "Learning Better Visual Dialog Agents with Pretrained
Visual-Linguistic Representation",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "5618-5627",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT241999"}

@inproceedings{bb247106,
        AUTHOR = "Jiang, T.L. and Ji, Y. and Liu, C.P.",
        TITLE = "Integrating Historical States and Co-attention Mechanism for Visual
Dialog",
        BOOKTITLE = ICPR21,
        YEAR = "2021",
        PAGES = "2041-2048",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242000"}

@inproceedings{bb247107,
        AUTHOR = "Nguyen, V.Q. and Suganuma, M. and Okatani, T.",
        TITLE = "Efficient Attention Mechanism for Visual Dialog that Can Handle All the
Interactions Between Multiple Inputs",
        BOOKTITLE = ECCV20,
        YEAR = "2020",
        PAGES = "XXIV:223-240",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242001"}

@inproceedings{bb247108,
        AUTHOR = "Murahari, V. and Batra, D. and Parikh, D. and Das, A.",
        TITLE = "Large-scale Pretraining for Visual Dialog:
A Simple State-of-the-art Baseline",
        BOOKTITLE = ECCV20,
        YEAR = "2020",
        PAGES = "XVIII:336-352",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242002"}

@inproceedings{bb247109,
        AUTHOR = "Zhu, Y. and Wu, Y. and Yang, Y. and Yan, Y.",
        TITLE = "Describing Unseen Videos via Multi-Modal Cooperative Dialog Agents",
        BOOKTITLE = ECCV20,
        YEAR = "2020",
        PAGES = "XXIII:153-169",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242003"}

@inproceedings{bb247110,
        AUTHOR = "Qi, J. and Niu, Y. and Huang, J. and Zhang, H.",
        TITLE = "Two Causal Principles for Improving Visual Dialog",
        BOOKTITLE = CVPR20,
        YEAR = "2020",
        PAGES = "10857-10866",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242004"}

@inproceedings{bb247111,
        AUTHOR = "Abbasnejad, E. and Teney, D. and Parvaneh, A. and Shi, J. and van den Hengel, A.J.",
        TITLE = "Counterfactual Vision and Language Learning",
        BOOKTITLE = CVPR20,
        YEAR = "2020",
        PAGES = "10041-10051",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242005"}

@inproceedings{bb247112,
        AUTHOR = "Zhu, Y. and Zhu, F. and Zhan, Z. and Lin, B. and Jiao, J. and Chang, X. and Liang, X.",
        TITLE = "Vision-Dialog Navigation by Exploring Cross-Modal Memory",
        BOOKTITLE = CVPR20,
        YEAR = "2020",
        PAGES = "10727-10736",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242006"}

@inproceedings{bb247113,
        AUTHOR = "Yang, T. and Zha, Z. and Zhang, H.",
        TITLE = "Making History Matter:
History-Advantage Sequence Training for Visual Dialog",
        BOOKTITLE = ICCV19,
        YEAR = "2019",
        PAGES = "2561-2569",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242007"}

@inproceedings{bb247114,
        AUTHOR = "Guo, D. and Xu, C. and Tao, D.C.",
        TITLE = "Image-Question-Answer Synergistic Network for Visual Dialog",
        BOOKTITLE = CVPR19,
        YEAR = "2019",
        PAGES = "10426-10435",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242008"}

@inproceedings{bb247115,
        AUTHOR = "Zheng, Z.L. and Wang, W.G. and Qi, S.Y. and Zhu, S.C.",
        TITLE = "Reasoning Visual Dialogs With Structural and Partial Observations",
        BOOKTITLE = CVPR19,
        YEAR = "2019",
        PAGES = "6662-6671",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242009"}

@inproceedings{bb247116,
        AUTHOR = "Bani, G. and Belli, D. and Dagan, G. and Geenen, A. and Skliar, A. and Venkatesh, A. and Baumgartner, T. and Bruni, E. and Fernandez, R.",
        TITLE = "Adding Object Detection Skills to Visual Dialogue Agents",
        BOOKTITLE = VL18,
        YEAR = "2018",
        PAGES = "IV:180-187",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242010"}

@inproceedings{bb247117,
        AUTHOR = "Yang, M. and Yang, N.S.R. and Zhang, K. and Tao, J.",
        TITLE = "Self-Talk: Responses to Users' Opinions and Challenges in Human
Computer Dialog",
        BOOKTITLE = ICPR18,
        YEAR = "2018",
        PAGES = "2839-2844",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242011"}

@inproceedings{bb247118,
        AUTHOR = "Jain, U. and Schwing, A. and Lazebnik, S.",
        TITLE = "Two Can Play This Game: Visual Dialog with Discriminative Question
Generation and Answering",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "5754-5763",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242012"}

@inproceedings{bb247119,
        AUTHOR = "Dokania, P.K. and Torr, P.H.S. and Siddharth, N. and Massiceti, D.",
        TITLE = "FLIPDIAL: A Generative Model for Two-Way Visual Dialogue",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "6097-6105",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242013"}

@inproceedings{bb247120,
        AUTHOR = "Wu, Q. and Wang, P. and Shen, C. and Reid, I.D. and van den Hengel, A.J.",
        TITLE = "Are You Talking to Me? Reasoned Visual Dialog Generation Through
Adversarial Learning",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "6106-6115",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242014"}

@inproceedings{bb247121,
        AUTHOR = "Kottur, S. and Moura, J.M.F. and Parikh, D. and Batra, D. and Rohrbach, M.",
        TITLE = "Visual Coreference Resolution in Visual Dialog Using Neural Module
Networks",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "XV: 160-178",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242015"}

@inproceedings{bb247122,
        AUTHOR = "Strub, F. and Seurin, M. and Perez, E. and de Vries, H. and Mary, J. and Preux, P. and Courville, A. and Pietquin, O.",
        TITLE = "Visual Reasoning with Multi-hop Feature Modulation",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "VI: 808-831",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242016"}

@inproceedings{bb247123,
        AUTHOR = "Das, A. and Kottur, S. and Moura, J.M.F. and Lee, S. and Batra, D.",
        TITLE = "Learning Cooperative Visual Dialog Agents with Deep Reinforcement
Learning",
        BOOKTITLE = ICCV17,
        YEAR = "2017",
        PAGES = "2970-2979",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242017"}

@inproceedings{bb247124,
        AUTHOR = "de Vries, H. and Strub, F. and Chandar, S. and Pietquin, O. and Larochelle, H. and Courville, A.",
        TITLE = "GuessWhat?! Visual Object Discovery through Multi-modal Dialogue",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "4466-4475",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242018"}

@inproceedings{bb247125,
        AUTHOR = "Nam, H. and Ha, J.W. and Kim, J.",
        TITLE = "Dual Attention Networks for Multimodal Reasoning and Matching",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "2156-2164",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242019"}

@inproceedings{bb247126,
        AUTHOR = "Johnson, J. and Hariharan, B. and van der Maaten, L. and Hoffman, J. and Fei Fei, L. and Zitnick, C.L. and Girshick, R.",
        TITLE = "Inferring and Executing Programs for Visual Reasoning",
        BOOKTITLE = ICCV17,
        YEAR = "2017",
        PAGES = "3008-3017",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242020"}

@inproceedings{bb247127,
        AUTHOR = "Johnson, J. and Hariharan, B. and van der Maaten, L. and Fei Fei, L. and Zitnick, C.L. and Girshick, R.",
        TITLE = "CLEVR: A Diagnostic Dataset for Compositional Language and Elementary
Visual Reasoning",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "1988-1997",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242021"}

@inproceedings{bb247128,
        AUTHOR = "Das, A. and Kottur, S. and Gupta, K. and Singh, A. and Yadav, D. and Moura, J.M.F. and Parikh, D. and Batra, D.",
        TITLE = "Visual Dialog",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "1080-1089",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT242022"}

@article{bb247129,
        AUTHOR = "Tamaazousti, Y. and Le Borgne, H. and Popescu, A. and Gadeski, E. and Ginsca, A. and Hudelot, C.",
        TITLE = "Vision-language integration using constrained local semantic features",
        JOURNAL = CVIU,
        VOLUME = "163",
        YEAR = "2017",
        NUMBER = "1",
        PAGES = "41-57",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242023"}

@article{bb247130,
        AUTHOR = "Zhu, Y.Q. and Li, X.Y. and Zheng, M. and Yang, J.H. and Wang, Z.H. and Guo, X.Q. and Chai, Z.F. and Yuan, Y.C. and Jiang, S.Q.",
        TITLE = "Focus and Align: Learning Tube Tokens for Video-Language Pre-Training",
        JOURNAL = MultMed,
        VOLUME = "25",
        YEAR = "2023",
        PAGES = "8036-8050",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242024"}

@article{bb247131,
        AUTHOR = "Wu, W.H. and Sun, Z. and Song, Y.X. and Wang, J.D. and Ouyang, W.L.",
        TITLE = "Transferring Vision-Language Models for Visual Recognition:
A Classifier Perspective",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "392-409",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242025"}

@article{bb247132,
        AUTHOR = "Yang, X.F. and Liu, F. and Lin, G.S.",
        TITLE = "Neural Logic Vision Language Explainer",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "3331-3340",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242026"}

@article{bb247133,
        AUTHOR = "Wang, Y.D. and Yu, Z.O. and Wang, J.D. and Heng, Q. and Chen, H. and Ye, W. and Xie, R. and Xie, X. and Zhang, S.K.",
        TITLE = "Exploring Vision-Language Models for Imbalanced Learning",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "224-237",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242027"}

@article{bb247134,
        AUTHOR = "Zeng, Y. and Zhang, X. and Li, H. and Wang, J.W. and Zhang, J.P. and Zhou, W.",
        TITLE = "X2-VLM: All-in-One Pre-Trained Model for Vision-Language Tasks",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "5",
        MONTH = "May",
        PAGES = "3156-3168",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242028"}

@article{bb247135,
        AUTHOR = "Kong, D. and Kong, K. and Kang, S.J.",
        TITLE = "Image clustering using generated text centroids",
        JOURNAL = SP:IC,
        VOLUME = "125",
        YEAR = "2024",
        PAGES = "117128",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242029"}

@article{bb247136,
        AUTHOR = "Chen, X.Y. and Yang, J.H. and Chen, S. and Wang, L. and Jiang, M. and Zhao, Q.",
        TITLE = "Every Problem, Every Step, All in Focus: Learning to Solve
Vision-Language Problems With Integrated Attention",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "4720-4735",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242030"}

@article{bb247137,
        AUTHOR = "Menon, S. and Chandratreya, I.P. and Vondrick, C.",
        TITLE = "Task Bias in Contrastive Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "2026-2040",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242031"}

@article{bb247138,
        AUTHOR = "Zhang, J.Y. and Huang, J.X. and Jin, S. and Lu, S.J.",
        TITLE = "Vision-Language Models for Vision Tasks: A Survey",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "5625-5644",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242032"}

@article{bb247139,
        AUTHOR = "Liu, Y. and Pan, Y. and Yin, J.",
        TITLE = "Enhancing Multi-Label Deep Hashing for Image and Audio With Joint
Internal Global Loss Constraints and Large Vision-Language Model",
        JOURNAL = SPLetters,
        VOLUME = "31",
        YEAR = "2024",
        PAGES = "2550-2554",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242033"}

@article{bb247140,
        AUTHOR = "Su, K. and Zhang, X.X. and Zhang, S.Y. and Zhu, J. and Zhang, B.",
        TITLE = "To Boost Zero-Shot Generalization for Embodied Reasoning With
Vision-Language Pre-Training",
        JOURNAL = IP,
        VOLUME = "33",
        YEAR = "2024",
        PAGES = "5370-5381",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242034"}

@article{bb247141,
        AUTHOR = "Sun, B. and Wu, Z.C. and Zhang, H. and He, J.",
        TITLE = "VTPL: Visual and text prompt learning for visual-language models",
        JOURNAL = JVCIR,
        VOLUME = "104",
        YEAR = "2024",
        PAGES = "104280",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242035"}

@article{bb247142,
        AUTHOR = "Liu, L.C. and Wang, N.N. and Liu, D. and Yang, X. and Gao, X.B. and Liu, T.L.",
        TITLE = "Towards Specific Domain Prompt Learning via Improved Text Label
Optimization",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "10805-10815",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242036"}

@article{bb247143,
        AUTHOR = "Liu, X. and Wu, J. and Yang, W.F. and Zhou, X. and Zhang, T.Z.",
        TITLE = "Multi-Modal Attribute Prompting for Vision-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "34",
        YEAR = "2024",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "11579-11591",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242037"}

@article{bb247144,
        AUTHOR = "Yellinek, N. and Karlinsky, L. and Giryes, R.",
        TITLE = "3VL: Using Trees to Improve Vision-Language Models' Interpretability",
        JOURNAL = IP,
        VOLUME = "34",
        YEAR = "2025",
        PAGES = "495-509",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242038"}

@article{bb247145,
        AUTHOR = "Ondeng, O. and Ouma, H. and Akuon, P.",
        TITLE = "Enriching visual feature representations for vision-language tasks
using spectral transforms",
        JOURNAL = IVC,
        VOLUME = "154",
        YEAR = "2025",
        PAGES = "105390",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242039"}

@article{bb247146,
        AUTHOR = "Long, S. and Zhao, Z. and Yuan, J.K. and Tan, Z.C. and Liu, J.J. and Feng, J.Y. and Wang, S.S. and Wang, J.D.",
        TITLE = "Mutual Prompt Leaning for Vision Language Models",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "1258-1276",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242040"}

@article{bb247147,
        AUTHOR = "Chen, Y. and Zhang, S. and Sun, Y. and Yang, J. and Liang, W.J. and Wang, H.R.",
        TITLE = "Artificial-Spiking Hierarchical Networks for Vision-Language
Representation Learning",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "2768-2781",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242041"}

@article{bb247148,
        AUTHOR = "Li, B.Z. and Wang, S.R. and Wang, S.Q. and Ye, Y.",
        TITLE = "High Efficiency Image Compression for Large Visual-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "2870-2880",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242042"}

@article{bb247149,
        AUTHOR = "Liu, L.C. and Wang, N.N. and Zhou, D.W. and Liu, D.C. and Yang, X. and Gao, X.B. and Liu, T.L.",
        TITLE = "Generalizable Prompt Learning via Gradient Constrained
Sharpness-Aware Minimization",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "1100-1113",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242043"}

@article{bb247150,
        AUTHOR = "Fang, Z.Q. and Yuan, Z.H. and Li, Z.Y. and Chen, J.Y. and Kuang, K. and Yao, Y.F. and Wu, F.",
        TITLE = "Cross-Modality Image Interpretation via Concept Decomposition Vector
of Visual-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "3024-3038",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242044"}

@article{bb247151,
        AUTHOR = "Ramzi, E. and Audebert, N. and Rambour, C. and Araujo, A. and Bitot, X. and Thome, N.",
        TITLE = "Optimization of Rank Losses for Image Retrieval",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "4317-4329",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242045"}

@inproceedings{bb247152,
        AUTHOR = "Lafon, M. and Ramzi, E. and Rambour, C. and Audebert, N. and Thome, N.",
        TITLE = "Gallop: Learning Global and Local Prompts for Vision-language Models",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXI: 264-282",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242046"}

@article{bb247153,
        AUTHOR = "Liu, K.C. and Wang, C.Q. and Han, X.D. and Liu, Y.J. and Chen, B.Q.",
        TITLE = "Generalized Robot Vision-Language Model via Linguistic Foreground-Aware
Contrast",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "3481-3518",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242047"}

@article{bb247154,
        AUTHOR = "Chen, B.Q. and Liu, Y.J. and Han, X.D. and Wang, C.Q. and Liu, K.C.",
        TITLE = "Generalized Robot Vision-Language Model via Linguistic Foreground-Aware
Contrast",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "4971-4971",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242047"}

@article{bb247155,
        AUTHOR = "Yang, L.X. and Zhang, R.Y. and Chen, Q. and Xie, X.H.",
        TITLE = "Learning with Enriched Inductive Biases for Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "3746-3761",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242048"}

@article{bb247156,
        AUTHOR = "Zeng, R.F. and Yang, Z.P. and Yu, R.Y. and Zhang, Y.G.",
        TITLE = "Supplementary Prompt Learning for Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "5822-5839",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242049"}

@article{bb247157,
        AUTHOR = "Liu, K.C. and Liu, Y.J. and Chen, B.Q.",
        TITLE = "General 3D Vision-Language Model With Fast Rendering and Pre-Training
Vision-Language Alignment",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "9",
        MONTH = "September",
        PAGES = "7352-7368",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242050"}

@article{bb247158,
        AUTHOR = "Wang, W.X. and He, X.J. and Zhang, Y. and Guo, L.T. and Shen, J.C. and Li, J.Y. and Liu, J.",
        TITLE = "CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring
Image Segmentation",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "6906-6916",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242051"}

@article{bb247159,
        AUTHOR = "Park, K.Y. and An, S. and Lee, Y.J. and Kim, D.H.",
        TITLE = "Learning Compositionality from Multifaceted Synthetic Data for
Language-based Object Detection",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "7873-7896",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242052"}

@inproceedings{bb247160,
        AUTHOR = "Park, K.Y. and Saito, K. and Kim, D.H.",
        TITLE = "Weak-to-strong Compositional Learning from Generative Models for
Language-based Object Detection",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXIII: 1-19",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242053"}

@article{bb247161,
        AUTHOR = "Sarto, S. and Moratelli, N. and Cornia, M. and Baraldi, L. and Cucchiara, R.",
        TITLE = "Positive-Augmented Contrastive Learning for Vision-and-Language
Evaluation and Training",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "7647-7671",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242054"}

@inproceedings{bb247162,
        AUTHOR = "Stefanini, M. and Cornia, M. and Baraldi, L. and Cucchiara, R.",
        TITLE = "A Novel Attention-based Aggregation Function to Combine Vision and
Language",
        BOOKTITLE = ICPR21,
        YEAR = "2021",
        PAGES = "1212-1219",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242055"}

@article{bb247163,
        AUTHOR = "Liu, L.C. and Wang, N.N. and Chen, C. and Liu, D. and Yang, X. and Gao, X.B. and Liu, T.L.",
        TITLE = "Frequency-Based Comprehensive Prompt Learning for Vision-Language
Models",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "11974-11989",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242056"}

@article{bb247164,
        AUTHOR = "Yang, X. and Zhong, X.Y. and Wang, N.N.",
        TITLE = "Distribution-Aware Prompt Learning for Vision-Language Models With
Dynamic Boundary Prototype",
        JOURNAL = IP,
        VOLUME = "35",
        YEAR = "2026",
        PAGES = "3537-3549",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242057"}

@article{bb247165,
        AUTHOR = "Xiao, Y.S. and Liu, X.L. and Cheng, Q.J. and Yin, Z.F. and Liang, S.Y. and Li, J.P. and Shao, J. and Liu, A.S. and Tao, D.C.",
        TITLE = "GenderBias-VL: Benchmarking Gender Bias in Vision Language Models via
Counterfactual Probing",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "8332-8355",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242058"}

@article{bb247166,
        AUTHOR = "Chen, T.Y. and Ai, J.L.",
        TITLE = "Hierarchical Prompt Engineering for Remote Sensing Scene
Understanding with Large Vision-Language Models",
        JOURNAL = RS,
        VOLUME = "17",
        YEAR = "2025",
        NUMBER = "22",
        PAGES = "3727",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242059"}

@article{bb247167,
        AUTHOR = "Xu, X. and Qin, L. and Che, W. and Kan, M.Y.",
        TITLE = "Manager: Aggregating Insights From Unimodal Experts in Two-Tower VLMs
and MLLMs",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "12278-12291",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242060"}

@article{bb247168,
        AUTHOR = "Kim, G. and Kim, S. and Lee, S.",
        TITLE = "Decoupling augmentation bias in prompt learning for vision-language
models",
        JOURNAL = PR,
        VOLUME = "172",
        YEAR = "2026",
        PAGES = "112630",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242061"}

@inproceedings{bb247169,
        AUTHOR = "Kim, G. and Kim, S. and Lee, S.",
        TITLE = "AAPL: Adding Attributes to Prompt Learning for Vision-Language Models",
        BOOKTITLE = Prompting24,
        YEAR = "2024",
        PAGES = "1572-1582",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242062"}

@article{bb247170,
        AUTHOR = "Guo, Y.C. and Gu, X.D.",
        TITLE = "MMRL++: Parameter-Efficient and Interaction-Aware Representation
Learning for Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "11",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242063"}

@inproceedings{bb247171,
        AUTHOR = "Guo, Y.C. and Gu, X.D.",
        TITLE = "MMRL: Multi-Modal Representation Learning for Vision-Language Models",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "25015-25025",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242064"}

@article{bb247172,
        AUTHOR = "Ye, W.X. and Wang, W. and Liu, Y.H. and Song, Y. and Ren, B. and Bi, W. and Cucchiara, R. and Sebe, N.",
        TITLE = "A Unified Masked Jigsaw Puzzle Framework for Vision and Language
Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "1873-1887",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242065"}

@article{bb247173,
        AUTHOR = "Wang, Z.Y. and Liu, L. and Wan, G. and Lu, Y.C. and Zheng, F.J. and Sun, G. and Huang, Y.X. and Guo, S.H. and Li, X. and Yuan, L.",
        TITLE = "SAREval: A Multi-Dimensional and Multi-Task Benchmark for Evaluating
Visual Language Models on SAR Image Understanding",
        JOURNAL = RS,
        VOLUME = "18",
        YEAR = "2026",
        NUMBER = "1",
        PAGES = "82",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242066"}

@article{bb247174,
        AUTHOR = "Wu, J.F. and Jiang, Y. and Ma, C.F. and Liu, Y.L. and Zhao, H.S. and Yuan, Z.H. and Bai, S. and Bai, X.",
        TITLE = "Liquid: Language Models are Scalable and Unified Multi-Modal Generators",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "39",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242067"}

@article{bb247175,
        AUTHOR = "Li, Y.W. and Zhang, Y.C. and Wang, C.Y. and Zhong, Z.S. and Chen, Y.X. and Chu, R. and Liu, S. and Jia, J.Y.",
        TITLE = "Mini-Gemini: Mining the Potential of Multi-Modality Vision Language
Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "3530-3543",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242068"}

@article{bb247176,
        AUTHOR = "Xu, N. and Yao, K. and Yang, R. and Li, C.",
        TITLE = "Visual-language active search for wide-area remote sensing imagery",
        JOURNAL = PR,
        VOLUME = "175",
        YEAR = "2026",
        PAGES = "113106",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242069"}

@article{bb247177,
        AUTHOR = "Qi, Y. and Li, H.X. and Song, Y.Q. and Wu, X.X. and Luo, J.B.",
        TITLE = "How Vision-Language Tasks Benefit From Large Pre-Trained Models:
A Survey",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "1188-1210",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242070"}

@article{bb247178,
        AUTHOR = "Lee, J.J.",
        TITLE = "Language-guided invariance probing of vision-language models",
        JOURNAL = PRL,
        VOLUME = "202",
        YEAR = "2026",
        PAGES = "108-113",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242071"}

@article{bb247179,
        AUTHOR = "Zhang, Y. and Bian, S. and Liu, J. and Song, R.J. and Zhu, D. and Zhang, C.H. and Hua, C.C.",
        TITLE = "Robot Active Task Cognition:
Situation-Aware Task Planning With Large Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "4722-4733",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242072"}

@article{bb247180,
        AUTHOR = "Yin, J.H. and Pu, N. and Zhang, X.Y. and Yang, L.F. and Wu, L. and Wang, X.J. and Zhong, Z.",
        TITLE = "Plug-and-play Class-aware Knowledge Injection for Prompt Learning with
Visual-Language Model",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "254",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242073"}

@article{bb247181,
        AUTHOR = "Yang, J.H. and Jiang, M. and Zhao, Q.",
        TITLE = "Defying Distractions in Multimodal Tasks: A Novel Benchmark for Large
Vision-Language Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "6314-6331",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242074"}

@article{bb247182,
        AUTHOR = "Wang, X.W.",
        TITLE = "TriFusion-RL: Integrating task verifiers, self-feedback, and
perceptual tools for vision-language models",
        JOURNAL = CVIU,
        VOLUME = "268",
        YEAR = "2026",
        PAGES = "104764",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242075"}

@article{bb247183,
        AUTHOR = "Chen, W.X. and Su, H.",
        TITLE = "Enhancing Multimodal Compositional Understanding of Vision-Language
Models With Semantic Decoupling and Feature Coupling",
        JOURNAL = SPLetters,
        VOLUME = "33",
        YEAR = "2026",
        PAGES = "3102-3106",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242076"}

@article{bb247184,
        AUTHOR = "Sun, Y.W. and Liu, C.B. and Fang, S.C. and Li, P.D. and Lu, Z.Y. and Xie, H.T.",
        TITLE = "RoFLIP: Robust and Fine-Grained Alignment for Vision-Language
Compositional Reasoning",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "9",
        MONTH = "September",
        PAGES = "401",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242077"}

@article{bb247185,
        AUTHOR = "Xiang, K. and Zhang, T.J.C. and Huang, Y. and He, J.X. and Liu, Z. and Tang, Y.L. and Zhou, R.Z. and Luo, L. and Wen, Y.P. and Chen, X. and Lin, B.Q. and Han, J.H. and Xu, H. and Li, H. and Dong, B. and Liang, X.D.",
        TITLE = "Aligning Perception, Reasoning, Modeling and Interaction:
A Survey on Physical AI",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "10",
        MONTH = "October",
        PAGES = "12938-12957",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242078"}

@article{bb247186,
        AUTHOR = "Yan, J. and Dong, B. and Guan, X.Y. and Zheng, W.S. and Zhang, T. and Wang, R.X.",
        TITLE = "Adaptively Fine-Tuning and Ensembling Vision-Language Model for
Few-Shot Image Classification",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "6770-6783",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242079"}

@inproceedings{bb247187,
        AUTHOR = "Kim, M.",
        TITLE = "PerVL-Bench: Benchmarking Multimodal Personalization for Large
Vision-Language Models",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "6696-6704",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242080"}

@inproceedings{bb247188,
        AUTHOR = "Kawarada, M. and Yamada, K. and Tejero de Pablos, A. and Inoue, N.",
        TITLE = "Training-free Conditional Image Embedding Framework Leveraging Large
Vision Language Models",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "7636-7646",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242081"}

@inproceedings{bb247189,
        AUTHOR = "Fahim, M. and Rahman, M.S.U. and Rahman, A.M. and Ishmam, M.F. and Rahman, M.T. and Shifat, F.T. and Haider, F. and Bhuiyan, M.F.A.",
        TITLE = "BanglaProtha: Evaluating Vision Language Models in Underrepresented
Long-tail Cultural Contexts",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "1159-1169",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242082"}

@inproceedings{bb247190,
        AUTHOR = "Lin, Z.X. and Haghighat, M. and Browne, W. and Miller, D.",
        TITLE = "Intra-Class Probabilistic Embeddings for Uncertainty Estimation in
Vision-Language Models",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "2327-2337",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242083"}

@inproceedings{bb247191,
        AUTHOR = "Gu, D.F. and Gao, Y.H. and Zhou, M. and Metaxas, D.N.",
        TITLE = "Anatomy-VLM: A Fine-grained Vision-Language Model for Medical
Interpretation",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "2838-2847",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242084"}

@inproceedings{bb247192,
        AUTHOR = "Zamini, M. and Shukla, D.",
        TITLE = "Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient
Vision-Language Models",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "3648-3657",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242085"}

@inproceedings{bb247193,
        AUTHOR = "Saravanan, D. and Tapaswi, M. and Gandhi, V.",
        TITLE = "Investigating Mechanisms for In-Context Vision Language Binding",
        BOOKTITLE = InterpVis25,
        YEAR = "2025",
        PAGES = "4852-4856",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242086"}

@inproceedings{bb247194,
        AUTHOR = "Selvam, S. and Rajendran, R.K. and Sankaradas, M. and Raghunathan, A. and Chakradhar, S.T.",
        TITLE = "SimCache: Similarity Caching for Efficient VLM-based Scene
Understanding",
        BOOKTITLE = LargeVM25,
        YEAR = "2025",
        PAGES = "3318-3327",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242087"}

@inproceedings{bb247195,
        AUTHOR = "Tushar, P. and Pandey, E. and Austria, L.D.B. and Loo, Y.Y. and Lim, J.H. and Atmosukarto, I. and Lock, D.S.C.",
        TITLE = "MerCulture: A Comprehensive Benchmark to Evaluate Vision-Language
Models on Cultural Understanding in Singapore",
        BOOKTITLE = "AIBench25",
        YEAR = "2025",
        PAGES = "565-574",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242088"}

@inproceedings{bb247196,
        AUTHOR = "Ma, Z.Y. and Gou, C. and Shi, H. and Sun, B. and Li, S.T. and Rezatofighi, H. and Cai, J.F.",
        TITLE = "DrVideo: Document Retrieval Based Long Video Understanding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "18936-18946",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242089"}

@inproceedings{bb247197,
        AUTHOR = "Dhouib, M. and Buscaldi, D. and Vanier, S. and Shabou, A.",
        TITLE = "PACT: Pruning and Clustering-Based Token Reduction for Faster Visual
Language Models",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "14582-14592",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242090"}

@inproceedings{bb247198,
        AUTHOR = "Nath, V. and Li, W.Q. and Yang, D. and Myronenko, A. and Zheng, M.X. and Lu, Y. and Liu, Z.J. and Yin, H.X. and Law, Y.M. and Tang, Y.C. and Guo, P.F. and Zhao, C. and Xu, Z.Y. and He, Y.F. and Harmon, S. and Simon, B. and Heinrich, G. and Aylward, S. and Edgar, M. and Zephyr, M. and Molchanov, P. and Turkbey, B. and Roth, H. and Xu, D.",
        TITLE = "VILA-M3: Enhancing Vision-Language Models with Medical Expert
Knowledge",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "14788-14798",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242091"}

@inproceedings{bb247199,
        AUTHOR = "Du, H. and Wu, B. and Lu, Y. and Mao, Z.D.",
        TITLE = "SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic
Video Situation",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "13798-13809",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT242092"}

Last update:Sep 30, 2026 at 11:45:00