@inproceedings{bb245000,
        AUTHOR = "Yang, T. and Zha, Z. and Zhang, H.",
        TITLE = "Making History Matter:
History-Advantage Sequence Training for Visual Dialog",
        BOOKTITLE = ICCV19,
        YEAR = "2019",
        PAGES = "2561-2569",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239908"}

@inproceedings{bb245001,
        AUTHOR = "Guo, D. and Xu, C. and Tao, D.C.",
        TITLE = "Image-Question-Answer Synergistic Network for Visual Dialog",
        BOOKTITLE = CVPR19,
        YEAR = "2019",
        PAGES = "10426-10435",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239909"}

@inproceedings{bb245002,
        AUTHOR = "Zheng, Z.L. and Wang, W.G. and Qi, S.Y. and Zhu, S.C.",
        TITLE = "Reasoning Visual Dialogs With Structural and Partial Observations",
        BOOKTITLE = CVPR19,
        YEAR = "2019",
        PAGES = "6662-6671",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239910"}

@inproceedings{bb245003,
        AUTHOR = "Bani, G. and Belli, D. and Dagan, G. and Geenen, A. and Skliar, A. and Venkatesh, A. and Baumgartner, T. and Bruni, E. and Fernandez, R.",
        TITLE = "Adding Object Detection Skills to Visual Dialogue Agents",
        BOOKTITLE = VL18,
        YEAR = "2018",
        PAGES = "IV:180-187",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239911"}

@inproceedings{bb245004,
        AUTHOR = "Yang, M. and Yang, N.S.R. and Zhang, K. and Tao, J.",
        TITLE = "Self-Talk: Responses to Users' Opinions and Challenges in Human
Computer Dialog",
        BOOKTITLE = ICPR18,
        YEAR = "2018",
        PAGES = "2839-2844",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239912"}

@inproceedings{bb245005,
        AUTHOR = "Jain, U. and Schwing, A. and Lazebnik, S.",
        TITLE = "Two Can Play This Game: Visual Dialog with Discriminative Question
Generation and Answering",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "5754-5763",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239913"}

@inproceedings{bb245006,
        AUTHOR = "Dokania, P.K. and Torr, P.H.S. and Siddharth, N. and Massiceti, D.",
        TITLE = "FLIPDIAL: A Generative Model for Two-Way Visual Dialogue",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "6097-6105",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239914"}

@inproceedings{bb245007,
        AUTHOR = "Wu, Q. and Wang, P. and Shen, C. and Reid, I.D. and van den Hengel, A.J.",
        TITLE = "Are You Talking to Me? Reasoned Visual Dialog Generation Through
Adversarial Learning",
        BOOKTITLE = CVPR18,
        YEAR = "2018",
        PAGES = "6106-6115",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239915"}

@inproceedings{bb245008,
        AUTHOR = "Kottur, S. and Moura, J.M.F. and Parikh, D. and Batra, D. and Rohrbach, M.",
        TITLE = "Visual Coreference Resolution in Visual Dialog Using Neural Module
Networks",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "XV: 160-178",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239916"}

@inproceedings{bb245009,
        AUTHOR = "Strub, F. and Seurin, M. and Perez, E. and de Vries, H. and Mary, J. and Preux, P. and Courville, A. and Pietquin, O.",
        TITLE = "Visual Reasoning with Multi-hop Feature Modulation",
        BOOKTITLE = ECCV18,
        YEAR = "2018",
        PAGES = "VI: 808-831",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239917"}

@inproceedings{bb245010,
        AUTHOR = "Das, A. and Kottur, S. and Moura, J.M.F. and Lee, S. and Batra, D.",
        TITLE = "Learning Cooperative Visual Dialog Agents with Deep Reinforcement
Learning",
        BOOKTITLE = ICCV17,
        YEAR = "2017",
        PAGES = "2970-2979",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239918"}

@inproceedings{bb245011,
        AUTHOR = "de Vries, H. and Strub, F. and Chandar, S. and Pietquin, O. and Larochelle, H. and Courville, A.",
        TITLE = "GuessWhat?! Visual Object Discovery through Multi-modal Dialogue",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "4466-4475",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239919"}

@inproceedings{bb245012,
        AUTHOR = "Nam, H. and Ha, J.W. and Kim, J.",
        TITLE = "Dual Attention Networks for Multimodal Reasoning and Matching",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "2156-2164",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239920"}

@inproceedings{bb245013,
        AUTHOR = "Johnson, J. and Hariharan, B. and van der Maaten, L. and Hoffman, J. and Fei Fei, L. and Zitnick, C.L. and Girshick, R.",
        TITLE = "Inferring and Executing Programs for Visual Reasoning",
        BOOKTITLE = ICCV17,
        YEAR = "2017",
        PAGES = "3008-3017",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239921"}

@inproceedings{bb245014,
        AUTHOR = "Johnson, J. and Hariharan, B. and van der Maaten, L. and Fei Fei, L. and Zitnick, C.L. and Girshick, R.",
        TITLE = "CLEVR: A Diagnostic Dataset for Compositional Language and Elementary
Visual Reasoning",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "1988-1997",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239922"}

@inproceedings{bb245015,
        AUTHOR = "Das, A. and Kottur, S. and Gupta, K. and Singh, A. and Yadav, D. and Moura, J.M.F. and Parikh, D. and Batra, D.",
        TITLE = "Visual Dialog",
        BOOKTITLE = CVPR17,
        YEAR = "2017",
        PAGES = "1080-1089",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239923"}

@article{bb245016,
        AUTHOR = "Tamaazousti, Y. and Le Borgne, H. and Popescu, A. and Gadeski, E. and Ginsca, A. and Hudelot, C.",
        TITLE = "Vision-language integration using constrained local semantic features",
        JOURNAL = CVIU,
        VOLUME = "163",
        YEAR = "2017",
        NUMBER = "1",
        PAGES = "41-57",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239924"}

@article{bb245017,
        AUTHOR = "Zhu, Y.Q. and Li, X.Y. and Zheng, M. and Yang, J.H. and Wang, Z.H. and Guo, X.Q. and Chai, Z.F. and Yuan, Y.C. and Jiang, S.Q.",
        TITLE = "Focus and Align: Learning Tube Tokens for Video-Language Pre-Training",
        JOURNAL = MultMed,
        VOLUME = "25",
        YEAR = "2023",
        PAGES = "8036-8050",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239925"}

@article{bb245018,
        AUTHOR = "Wu, W.H. and Sun, Z. and Song, Y.X. and Wang, J.D. and Ouyang, W.L.",
        TITLE = "Transferring Vision-Language Models for Visual Recognition:
A Classifier Perspective",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "392-409",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239926"}

@article{bb245019,
        AUTHOR = "Ming, Y.F. and Li, Y.X.",
        TITLE = "How Does Fine-Tuning Impact Out-of-Distribution Detection for
Vision-Language Models?",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "596-609",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239927"}

@article{bb245020,
        AUTHOR = "Zhao, C.R. and Wang, Y. and Jiang, X.Y. and Shen, Y.F. and Song, K. and Li, D.S. and Miao, D.Q.",
        TITLE = "Learning Domain Invariant Prompt for Vision-Language Models",
        JOURNAL = IP,
        VOLUME = "33",
        YEAR = "2024",
        PAGES = "1348-1360",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239928"}

@article{bb245021,
        AUTHOR = "Yang, X.F. and Liu, F. and Lin, G.S.",
        TITLE = "Neural Logic Vision Language Explainer",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "3331-3340",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239929"}

@article{bb245022,
        AUTHOR = "Wang, Y.D. and Yu, Z.O. and Wang, J.D. and Heng, Q. and Chen, H. and Ye, W. and Xie, R. and Xie, X. and Zhang, S.K.",
        TITLE = "Exploring Vision-Language Models for Imbalanced Learning",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "224-237",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239930"}

@article{bb245023,
        AUTHOR = "Zeng, Y. and Zhang, X. and Li, H. and Wang, J.W. and Zhang, J.P. and Zhou, W.",
        TITLE = "X2-VLM: All-in-One Pre-Trained Model for Vision-Language Tasks",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "5",
        MONTH = "May",
        PAGES = "3156-3168",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239931"}

@article{bb245024,
        AUTHOR = "Kong, D. and Kong, K. and Kang, S.J.",
        TITLE = "Image clustering using generated text centroids",
        JOURNAL = SP:IC,
        VOLUME = "125",
        YEAR = "2024",
        PAGES = "117128",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239932"}

@article{bb245025,
        AUTHOR = "Chen, X.Y. and Yang, J.H. and Chen, S. and Wang, L. and Jiang, M. and Zhao, Q.",
        TITLE = "Every Problem, Every Step, All in Focus: Learning to Solve
Vision-Language Problems With Integrated Attention",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "4720-4735",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239933"}

@article{bb245026,
        AUTHOR = "Menon, S. and Chandratreya, I.P. and Vondrick, C.",
        TITLE = "Task Bias in Contrastive Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "132",
        YEAR = "2024",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "2026-2040",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239934"}

@article{bb245027,
        AUTHOR = "Zhang, J.Y. and Huang, J.X. and Jin, S. and Lu, S.J.",
        TITLE = "Vision-Language Models for Vision Tasks: A Survey",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "5625-5644",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239935"}

@article{bb245028,
        AUTHOR = "Dong, M.P. and Li, F. and Li, Z.B. and Liu, X.",
        TITLE = "Cluster prototype earth mover's distance adapters and
alignment-guided prompt learning for vision-language models",
        JOURNAL = PR,
        VOLUME = "156",
        YEAR = "2024",
        PAGES = "110861",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239936"}

@article{bb245029,
        AUTHOR = "Liu, Y. and Pan, Y. and Yin, J.",
        TITLE = "Enhancing Multi-Label Deep Hashing for Image and Audio With Joint
Internal Global Loss Constraints and Large Vision-Language Model",
        JOURNAL = SPLetters,
        VOLUME = "31",
        YEAR = "2024",
        PAGES = "2550-2554",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239937"}

@article{bb245030,
        AUTHOR = "Zhan, C.L. and Zhang, Y.F. and Lin, Y. and Wang, G.A. and Wang, H.W.",
        TITLE = "UniDCP: Unifying Multiple Medical Vision-Language Tasks via Dynamic
Cross-Modal Learnable Prompts",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "9736-9748",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239938"}

@article{bb245031,
        AUTHOR = "Su, K. and Zhang, X.X. and Zhang, S.Y. and Zhu, J. and Zhang, B.",
        TITLE = "To Boost Zero-Shot Generalization for Embodied Reasoning With
Vision-Language Pre-Training",
        JOURNAL = IP,
        VOLUME = "33",
        YEAR = "2024",
        PAGES = "5370-5381",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239939"}

@article{bb245032,
        AUTHOR = "Xuan, S.Y. and Yang, M. and Zhang, S.L.",
        TITLE = "Adapting Vision-Language Models via Learning to Inject Knowledge",
        JOURNAL = IP,
        VOLUME = "33",
        YEAR = "2024",
        PAGES = "5798-5809",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239940"}

@article{bb245033,
        AUTHOR = "Zhou, W. and Zhou, Z.H.",
        TITLE = "Unsupervised Domain Adaption Harnessing Vision-Language Pre-Training",
        JOURNAL = CirSysVideo,
        VOLUME = "34",
        YEAR = "2024",
        NUMBER = "9",
        MONTH = "September",
        PAGES = "8201-8214",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239941"}

@article{bb245034,
        AUTHOR = "Guo, M.H. and Zhang, Y. and Mu, T.J. and Huang, S.X. and Hu, S.M.",
        TITLE = "Tuning Vision-Language Models With Multiple Prototypes Clustering",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "11186-11199",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239942"}

@article{bb245035,
        AUTHOR = "Sun, B. and Wu, Z.C. and Zhang, H. and He, J.",
        TITLE = "VTPL: Visual and text prompt learning for visual-language models",
        JOURNAL = JVCIR,
        VOLUME = "104",
        YEAR = "2024",
        PAGES = "104280",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239943"}

@article{bb245036,
        AUTHOR = "Liu, L.C. and Wang, N.N. and Liu, D. and Yang, X. and Gao, X.B. and Liu, T.L.",
        TITLE = "Towards Specific Domain Prompt Learning via Improved Text Label
Optimization",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "10805-10815",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239944"}

@article{bb245037,
        AUTHOR = "Liu, X. and Wu, J. and Yang, W.F. and Zhou, X. and Zhang, T.Z.",
        TITLE = "Multi-Modal Attribute Prompting for Vision-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "34",
        YEAR = "2024",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "11579-11591",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239945"}

@article{bb245038,
        AUTHOR = "Jiang, H.J. and Zhang, J.K. and Huang, R. and Ge, C.J. and Ni, Z. and Song, S. and Huang, G.",
        TITLE = "Cross-modal adapter for vision-language retrieval",
        JOURNAL = PR,
        VOLUME = "159",
        YEAR = "2025",
        PAGES = "111144",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239946"}

@article{bb245039,
        AUTHOR = "Yellinek, N. and Karlinsky, L. and Giryes, R.",
        TITLE = "3VL: Using Trees to Improve Vision-Language Models' Interpretability",
        JOURNAL = IP,
        VOLUME = "34",
        YEAR = "2025",
        PAGES = "495-509",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239947"}

@article{bb245040,
        AUTHOR = "Yang, L.F. and Li, X. and Wang, Y.Z. and Wang, X.L. and Yang, J.",
        TITLE = "Fine-Grained Visual Text Prompting",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "1594-1609",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239948"}

@article{bb245041,
        AUTHOR = "Wang, F. and Han, Z.Y. and Liu, X. and Yin, Y.L. and Gao, X.",
        TITLE = "CTPT: Continual Test-time Prompt Tuning for vision-language models",
        JOURNAL = PR,
        VOLUME = "161",
        YEAR = "2025",
        PAGES = "111300",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239949"}

@article{bb245042,
        AUTHOR = "Liang, N. and Liu, Y.",
        TITLE = "DPO: Discrete Prompt Optimization for Vision-Language Models",
        JOURNAL = SPLetters,
        VOLUME = "32",
        YEAR = "2025",
        PAGES = "671-675",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239950"}

@article{bb245043,
        AUTHOR = "Ondeng, O. and Ouma, H. and Akuon, P.",
        TITLE = "Enriching visual feature representations for vision-language tasks
using spectral transforms",
        JOURNAL = IVC,
        VOLUME = "154",
        YEAR = "2025",
        PAGES = "105390",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239951"}

@article{bb245044,
        AUTHOR = "Xu, C. and Zhu, Y.H. and Shen, H.C. and Chen, B.H. and Liao, Y.X. and Chen, X.X. and Wang, L.M.",
        TITLE = "Progressive Visual Prompt Learning with Contrastive Feature
Re-formation",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "511-526",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239952"}

@article{bb245045,
        AUTHOR = "Long, S. and Zhao, Z. and Yuan, J.K. and Tan, Z.C. and Liu, J.J. and Feng, J.Y. and Wang, S.S. and Wang, J.D.",
        TITLE = "Mutual Prompt Leaning for Vision Language Models",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "1258-1276",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239953"}

@article{bb245046,
        AUTHOR = "Yin, J.H. and Zhang, X.Y. and Wu, L. and Wang, X.J.",
        TITLE = "Context-aware prompt learning for test-time vision recognition with
frozen vision-language model",
        JOURNAL = PR,
        VOLUME = "162",
        YEAR = "2025",
        PAGES = "111359",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239954"}

@article{bb245047,
        AUTHOR = "Chen, Y. and Zhang, S. and Sun, Y. and Yang, J. and Liang, W.J. and Wang, H.R.",
        TITLE = "Artificial-Spiking Hierarchical Networks for Vision-Language
Representation Learning",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "2768-2781",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239955"}

@article{bb245048,
        AUTHOR = "Li, B.Z. and Wang, S.R. and Wang, S.Q. and Ye, Y.",
        TITLE = "High Efficiency Image Compression for Large Visual-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "2870-2880",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239956"}

@article{bb245049,
        AUTHOR = "Liu, L.C. and Wang, N.N. and Zhou, D.W. and Liu, D.C. and Yang, X. and Gao, X.B. and Liu, T.L.",
        TITLE = "Generalizable Prompt Learning via Gradient Constrained
Sharpness-Aware Minimization",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "1100-1113",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239957"}

@article{bb245050,
        AUTHOR = "Lu, Z. and Bai, J. and Li, X. and Xiao, Z. and Wang, X.C.",
        TITLE = "Task-to-Instance Prompt Learning for Vision-Language Models at Test
Time",
        JOURNAL = IP,
        VOLUME = "34",
        YEAR = "2025",
        PAGES = "1908-1920",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239958"}

@article{bb245051,
        AUTHOR = "Fang, Z.Q. and Yuan, Z.H. and Li, Z.Y. and Chen, J.Y. and Kuang, K. and Yao, Y.F. and Wu, F.",
        TITLE = "Cross-Modality Image Interpretation via Concept Decomposition Vector
of Visual-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "3024-3038",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239959"}

@article{bb245052,
        AUTHOR = "Ramzi, E. and Audebert, N. and Rambour, C. and Araujo, A. and Bitot, X. and Thome, N.",
        TITLE = "Optimization of Rank Losses for Image Retrieval",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "4317-4329",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239960"}

@inproceedings{bb245053,
        AUTHOR = "Lafon, M. and Ramzi, E. and Rambour, C. and Audebert, N. and Thome, N.",
        TITLE = "Gallop: Learning Global and Local Prompts for Vision-language Models",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXI: 264-282",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239961"}

@article{bb245054,
        AUTHOR = "Liu, K.C. and Wang, C.Q. and Han, X.D. and Liu, Y.J. and Chen, B.Q.",
        TITLE = "Generalized Robot Vision-Language Model via Linguistic Foreground-Aware
Contrast",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "3481-3518",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239962"}

@article{bb245055,
        AUTHOR = "Chen, B.Q. and Liu, Y.J. and Han, X.D. and Wang, C.Q. and Liu, K.C.",
        TITLE = "Generalized Robot Vision-Language Model via Linguistic Foreground-Aware
Contrast",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "4971-4971",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239962"}

@article{bb245056,
        AUTHOR = "Yang, L.X. and Zhang, R.Y. and Chen, Q. and Xie, X.H.",
        TITLE = "Learning with Enriched Inductive Biases for Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "3746-3761",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239963"}

@article{bb245057,
        AUTHOR = "Yao, H.T. and Zhang, R. and Lyu, H.H. and Zhang, Y.D. and Xu, C.S.",
        TITLE = "Bi-Modality Individual-Aware Prompt Tuning for Visual-Language Model",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "6352-6368",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239964"}

@inproceedings{bb245058,
        AUTHOR = "Yao, H.T. and Zhang, R. and Xu, C.S.",
        TITLE = "TCP: Textual-Based Class-Aware Prompt Tuning for Visual-Language
Model",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "23438-23448",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239965"}

@article{bb245059,
        AUTHOR = "Hao, Z.W. and Guo, J.Y. and Shen, L. and Luo, Y. and Hu, H. and Wen, Y.G.",
        TITLE = "ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language
Tuning",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "5527-5543",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239966"}

@article{bb245060,
        AUTHOR = "Zeng, R.F. and Yang, Z.P. and Yu, R.Y. and Zhang, Y.G.",
        TITLE = "Supplementary Prompt Learning for Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "5822-5839",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239967"}

@article{bb245061,
        AUTHOR = "Liu, K.C. and Liu, Y.J. and Chen, B.Q.",
        TITLE = "General 3D Vision-Language Model With Fast Rendering and Pre-Training
Vision-Language Alignment",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "9",
        MONTH = "September",
        PAGES = "7352-7368",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239968"}

@article{bb245062,
        AUTHOR = "Gao, Y.S. and Zhu, Z.X. and Wang, S.S.",
        TITLE = "Mixture of coarse and fine-grained prompt tuning for vision-language
model",
        JOURNAL = PR,
        VOLUME = "170",
        YEAR = "2026",
        PAGES = "112074",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239969"}

@article{bb245063,
        AUTHOR = "Hao, F.S. and Liu, L. and Wu, F.X. and Zhang, Q.S. and Cheng, J.",
        TITLE = "Textual Embeddings are Good Class-Aware Visual Prompts for Adapting
Vision-Language Models",
        JOURNAL = SPLetters,
        VOLUME = "32",
        YEAR = "2025",
        PAGES = "2992-2996",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239970"}

@article{bb245064,
        AUTHOR = "Liu, J. and Lu, Z.Q. and Luo, H. and Lu, Z.M. and Zheng, Y.M.",
        TITLE = "Progressive Multi-Prompt Learning for Vision-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "10",
        MONTH = "October",
        PAGES = "9562-9574",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239971"}

@article{bb245065,
        AUTHOR = "Wang, W.X. and He, X.J. and Zhang, Y. and Guo, L.T. and Shen, J.C. and Li, J.Y. and Liu, J.",
        TITLE = "CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring
Image Segmentation",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "6906-6916",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239972"}

@article{bb245066,
        AUTHOR = "Zhang, E. and Zhu, B. and Chen, Y.Y. and Miao, Q.H. and Tang, M. and Wang, J.Q.",
        TITLE = "Optimization of Prompt Learning via Multi-Knowledge Representation
for Vision-Language Models",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "7557-7569",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239973"}

@article{bb245067,
        AUTHOR = "Park, K.Y. and An, S. and Lee, Y.J. and Kim, D.H.",
        TITLE = "Learning Compositionality from Multifaceted Synthetic Data for
Language-based Object Detection",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "7873-7896",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239974"}

@inproceedings{bb245068,
        AUTHOR = "Park, K.Y. and Saito, K. and Kim, D.H.",
        TITLE = "Weak-to-strong Compositional Learning from Generative Models for
Language-based Object Detection",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXIII: 1-19",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239975"}

@article{bb245069,
        AUTHOR = "Sarto, S. and Moratelli, N. and Cornia, M. and Baraldi, L. and Cucchiara, R.",
        TITLE = "Positive-Augmented Contrastive Learning for Vision-and-Language
Evaluation and Training",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "7647-7671",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239976"}

@inproceedings{bb245070,
        AUTHOR = "Stefanini, M. and Cornia, M. and Baraldi, L. and Cucchiara, R.",
        TITLE = "A Novel Attention-based Aggregation Function to Combine Vision and
Language",
        BOOKTITLE = ICPR21,
        YEAR = "2021",
        PAGES = "1212-1219",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239977"}

@article{bb245071,
        AUTHOR = "Liu, L.C. and Wang, N.N. and Chen, C. and Liu, D. and Yang, X. and Gao, X.B. and Liu, T.L.",
        TITLE = "Frequency-Based Comprehensive Prompt Learning for Vision-Language
Models",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "11974-11989",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239978"}

@article{bb245072,
        AUTHOR = "Yang, X. and Zhong, X.Y. and Wang, N.N.",
        TITLE = "Distribution-Aware Prompt Learning for Vision-Language Models With
Dynamic Boundary Prototype",
        JOURNAL = IP,
        VOLUME = "35",
        YEAR = "2026",
        PAGES = "3537-3549",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239979"}

@article{bb245073,
        AUTHOR = "Li, J.C. and Gao, M. and Tang, S.L. and Wei, L.H. and Xiao, J. and Wu, F. and Hong, R.C. and Wang, M. and Tian, Q.",
        TITLE = "Structure-Induced Gradient Regulation for Generalizable
Vision-Language Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "219-235",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239980"}

@inproceedings{bb245074,
        AUTHOR = "Li, J.C. and Gao, M. and Wei, L.H. and Tang, S.L. and Zhang, W.Q. and Li, M.Z. and Ji, W. and Tian, Q. and Chua, T.S. and Zhuang, Y.T.",
        TITLE = "Gradient-Regulated Meta-Prompt Learning for Generalizable
Vision-Language Models",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2551-2562",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239981"}

@article{bb245075,
        AUTHOR = "Xiao, Y.S. and Liu, X.L. and Cheng, Q.J. and Yin, Z.F. and Liang, S.Y. and Li, J.P. and Shao, J. and Liu, A.S. and Tao, D.C.",
        TITLE = "GenderBias-VL: Benchmarking Gender Bias in Vision Language Models via
Counterfactual Probing",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "8332-8355",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239982"}

@article{bb245076,
        AUTHOR = "Chen, T.Y. and Ai, J.L.",
        TITLE = "Hierarchical Prompt Engineering for Remote Sensing Scene
Understanding with Large Vision-Language Models",
        JOURNAL = RS,
        VOLUME = "17",
        YEAR = "2025",
        NUMBER = "22",
        PAGES = "3727",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239983"}

@article{bb245077,
        AUTHOR = "Xu, X. and Qin, L. and Che, W. and Kan, M.Y.",
        TITLE = "Manager: Aggregating Insights From Unimodal Experts in Two-Tower VLMs
and MLLMs",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "12278-12291",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239984"}

@article{bb245078,
        AUTHOR = "Kim, G. and Kim, S. and Lee, S.",
        TITLE = "Decoupling augmentation bias in prompt learning for vision-language
models",
        JOURNAL = PR,
        VOLUME = "172",
        YEAR = "2026",
        PAGES = "112630",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239985"}

@inproceedings{bb245079,
        AUTHOR = "Kim, G. and Kim, S. and Lee, S.",
        TITLE = "AAPL: Adding Attributes to Prompt Learning for Vision-Language Models",
        BOOKTITLE = Prompting24,
        YEAR = "2024",
        PAGES = "1572-1582",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239986"}

@article{bb245080,
        AUTHOR = "Guo, Y.C. and Gu, X.D.",
        TITLE = "MMRL++: Parameter-Efficient and Interaction-Aware Representation
Learning for Vision-Language Models",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "11",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239987"}

@inproceedings{bb245081,
        AUTHOR = "Guo, Y.C. and Gu, X.D.",
        TITLE = "MMRL: Multi-Modal Representation Learning for Vision-Language Models",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "25015-25025",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239988"}

@article{bb245082,
        AUTHOR = "Ye, W.X. and Wang, W. and Liu, Y.H. and Song, Y. and Ren, B. and Bi, W. and Cucchiara, R. and Sebe, N.",
        TITLE = "A Unified Masked Jigsaw Puzzle Framework for Vision and Language
Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "2",
        MONTH = "February",
        PAGES = "1873-1887",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239989"}

@article{bb245083,
        AUTHOR = "Wang, Z.Y. and Liu, L. and Wan, G. and Lu, Y.C. and Zheng, F.J. and Sun, G. and Huang, Y.X. and Guo, S.H. and Li, X. and Yuan, L.",
        TITLE = "SAREval: A Multi-Dimensional and Multi-Task Benchmark for Evaluating
Visual Language Models on SAR Image Understanding",
        JOURNAL = RS,
        VOLUME = "18",
        YEAR = "2026",
        NUMBER = "1",
        PAGES = "82",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239990"}

@article{bb245084,
        AUTHOR = "Wu, J.F. and Jiang, Y. and Ma, C.F. and Liu, Y.L. and Zhao, H.S. and Yuan, Z.H. and Bai, S. and Bai, X.",
        TITLE = "Liquid: Language Models are Scalable and Unified Multi-Modal Generators",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "39",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239991"}

@article{bb245085,
        AUTHOR = "Su, Y.L. and Liu, X.L. and Huang, Z. and Zhao, Y.W. and Hong, R.C. and Wang, M.",
        TITLE = "AttriPrompt: Class Attribute-Aware Prompt Tuning for Vision-Language
Model",
        JOURNAL = IP,
        VOLUME = "35",
        YEAR = "2026",
        PAGES = "1395-1407",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239992"}

@article{bb245086,
        AUTHOR = "Li, Y.W. and Zhang, Y.C. and Wang, C.Y. and Zhong, Z.S. and Chen, Y.X. and Chu, R. and Liu, S. and Jia, J.Y.",
        TITLE = "Mini-Gemini: Mining the Potential of Multi-Modality Vision Language
Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "3530-3543",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239993"}

@article{bb245087,
        AUTHOR = "Xu, N. and Yao, K. and Yang, R. and Li, C.",
        TITLE = "Visual-language active search for wide-area remote sensing imagery",
        JOURNAL = PR,
        VOLUME = "175",
        YEAR = "2026",
        PAGES = "113106",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239994"}

@article{bb245088,
        AUTHOR = "Chen, Y. and Fu, S. and Zhang, Y.",
        TITLE = "MoPD: Mixture-of-Prompts Distillation for Vision-Language Models",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "1943-1954",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239995"}

@article{bb245089,
        AUTHOR = "Qi, Y. and Li, H.X. and Song, Y.Q. and Wu, X.X. and Luo, J.B.",
        TITLE = "How Vision-Language Tasks Benefit From Large Pre-Trained Models:
A Survey",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "1188-1210",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239996"}

@article{bb245090,
        AUTHOR = "Lee, J.J.",
        TITLE = "Language-guided invariance probing of vision-language models",
        JOURNAL = PRL,
        VOLUME = "202",
        YEAR = "2026",
        PAGES = "108-113",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239997"}

@article{bb245091,
        AUTHOR = "Zhang, Y. and Bian, S. and Liu, J. and Song, R.J. and Zhu, D. and Zhang, C.H. and Hua, C.C.",
        TITLE = "Robot Active Task Cognition:
Situation-Aware Task Planning With Large Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "4722-4733",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239998"}

@article{bb245092,
        AUTHOR = "Zhao, X.Y. and Li, X.T. and Duan, H.D. and Huang, H. and Li, Y. and Chen, K. and Yang, H.",
        TITLE = "MG-LLaVA: Toward Multi-Granularity Visual Instruction Tuning",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "4464-4478",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239999"}

@article{bb245093,
        AUTHOR = "Zhang, J.M. and Wang, X. and Ma, X.J. and Qiu, L.Y. and Jiang, Y.G. and Sang, J.",
        TITLE = "NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust
Vision-Language Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "6615-6627",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240000"}

@inproceedings{bb245094,
        AUTHOR = "Wang, X. and Chen, K. and Zhang, J.M. and Chen, J.J. and Ma, X.J.",
        TITLE = "TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in
Vision-Language Models",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "19910-19920",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240001"}

@article{bb245095,
        AUTHOR = "Yin, J.H. and Pu, N. and Zhang, X.Y. and Yang, L.F. and Wu, L. and Wang, X.J. and Zhong, Z.",
        TITLE = "Plug-and-play Class-aware Knowledge Injection for Prompt Learning with
Visual-Language Model",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "254",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240002"}

@article{bb245096,
        AUTHOR = "Yang, J.H. and Jiang, M. and Zhao, Q.",
        TITLE = "Defying Distractions in Multimodal Tasks: A Novel Benchmark for Large
Vision-Language Models",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "6314-6331",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240003"}

@article{bb245097,
        AUTHOR = "Wang, X.W.",
        TITLE = "TriFusion-RL: Integrating task verifiers, self-feedback, and
perceptual tools for vision-language models",
        JOURNAL = CVIU,
        VOLUME = "268",
        YEAR = "2026",
        PAGES = "104764",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240004"}

@article{bb245098,
        AUTHOR = "Liu, X. and Lan, N. and Wei, M.J. and Xie, X.M. and Shi, G.M.",
        TITLE = "SceneReasoner: Sufficient Embodied Scene Understanding From Limited
Perception by Explicit Functional Association",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "5",
        MONTH = "May",
        PAGES = "6456-6471",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240005"}

@article{bb245099,
        AUTHOR = "Wang, G.Q. and Zhao, P. and Wang, X. and Guo, H.R. and Qi, N. and Yang, S. and Guo, Q.H.",
        TITLE = "DHPT: Dual-Modality Heterogeneous Prompt Tuning for Online Test-Time
Adaption in Vision-Language Models",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "8590-8601",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240006"}

Last update:Aug 19, 2026 at 13:26:35