@inproceedings{bb245000,
AUTHOR = "Yang, T. and Zha, Z. and Zhang, H.",
TITLE = "Making History Matter:
History-Advantage Sequence Training for Visual Dialog",
BOOKTITLE = ICCV19,
YEAR = "2019",
PAGES = "2561-2569",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239908"}
@inproceedings{bb245001,
AUTHOR = "Guo, D. and Xu, C. and Tao, D.C.",
TITLE = "Image-Question-Answer Synergistic Network for Visual Dialog",
BOOKTITLE = CVPR19,
YEAR = "2019",
PAGES = "10426-10435",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239909"}
@inproceedings{bb245002,
AUTHOR = "Zheng, Z.L. and Wang, W.G. and Qi, S.Y. and Zhu, S.C.",
TITLE = "Reasoning Visual Dialogs With Structural and Partial Observations",
BOOKTITLE = CVPR19,
YEAR = "2019",
PAGES = "6662-6671",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239910"}
@inproceedings{bb245003,
AUTHOR = "Bani, G. and Belli, D. and Dagan, G. and Geenen, A. and Skliar, A. and Venkatesh, A. and Baumgartner, T. and Bruni, E. and Fernandez, R.",
TITLE = "Adding Object Detection Skills to Visual Dialogue Agents",
BOOKTITLE = VL18,
YEAR = "2018",
PAGES = "IV:180-187",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239911"}
@inproceedings{bb245004,
AUTHOR = "Yang, M. and Yang, N.S.R. and Zhang, K. and Tao, J.",
TITLE = "Self-Talk: Responses to Users' Opinions and Challenges in Human
Computer Dialog",
BOOKTITLE = ICPR18,
YEAR = "2018",
PAGES = "2839-2844",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239912"}
@inproceedings{bb245005,
AUTHOR = "Jain, U. and Schwing, A. and Lazebnik, S.",
TITLE = "Two Can Play This Game: Visual Dialog with Discriminative Question
Generation and Answering",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "5754-5763",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239913"}
@inproceedings{bb245006,
AUTHOR = "Dokania, P.K. and Torr, P.H.S. and Siddharth, N. and Massiceti, D.",
TITLE = "FLIPDIAL: A Generative Model for Two-Way Visual Dialogue",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "6097-6105",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239914"}
@inproceedings{bb245007,
AUTHOR = "Wu, Q. and Wang, P. and Shen, C. and Reid, I.D. and van den Hengel, A.J.",
TITLE = "Are You Talking to Me? Reasoned Visual Dialog Generation Through
Adversarial Learning",
BOOKTITLE = CVPR18,
YEAR = "2018",
PAGES = "6106-6115",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239915"}
@inproceedings{bb245008,
AUTHOR = "Kottur, S. and Moura, J.M.F. and Parikh, D. and Batra, D. and Rohrbach, M.",
TITLE = "Visual Coreference Resolution in Visual Dialog Using Neural Module
Networks",
BOOKTITLE = ECCV18,
YEAR = "2018",
PAGES = "XV: 160-178",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239916"}
@inproceedings{bb245009,
AUTHOR = "Strub, F. and Seurin, M. and Perez, E. and de Vries, H. and Mary, J. and Preux, P. and Courville, A. and Pietquin, O.",
TITLE = "Visual Reasoning with Multi-hop Feature Modulation",
BOOKTITLE = ECCV18,
YEAR = "2018",
PAGES = "VI: 808-831",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239917"}
@inproceedings{bb245010,
AUTHOR = "Das, A. and Kottur, S. and Moura, J.M.F. and Lee, S. and Batra, D.",
TITLE = "Learning Cooperative Visual Dialog Agents with Deep Reinforcement
Learning",
BOOKTITLE = ICCV17,
YEAR = "2017",
PAGES = "2970-2979",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239918"}
@inproceedings{bb245011,
AUTHOR = "de Vries, H. and Strub, F. and Chandar, S. and Pietquin, O. and Larochelle, H. and Courville, A.",
TITLE = "GuessWhat?! Visual Object Discovery through Multi-modal Dialogue",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "4466-4475",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239919"}
@inproceedings{bb245012,
AUTHOR = "Nam, H. and Ha, J.W. and Kim, J.",
TITLE = "Dual Attention Networks for Multimodal Reasoning and Matching",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "2156-2164",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239920"}
@inproceedings{bb245013,
AUTHOR = "Johnson, J. and Hariharan, B. and van der Maaten, L. and Hoffman, J. and Fei Fei, L. and Zitnick, C.L. and Girshick, R.",
TITLE = "Inferring and Executing Programs for Visual Reasoning",
BOOKTITLE = ICCV17,
YEAR = "2017",
PAGES = "3008-3017",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239921"}
@inproceedings{bb245014,
AUTHOR = "Johnson, J. and Hariharan, B. and van der Maaten, L. and Fei Fei, L. and Zitnick, C.L. and Girshick, R.",
TITLE = "CLEVR: A Diagnostic Dataset for Compositional Language and Elementary
Visual Reasoning",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "1988-1997",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239922"}
@inproceedings{bb245015,
AUTHOR = "Das, A. and Kottur, S. and Gupta, K. and Singh, A. and Yadav, D. and Moura, J.M.F. and Parikh, D. and Batra, D.",
TITLE = "Visual Dialog",
BOOKTITLE = CVPR17,
YEAR = "2017",
PAGES = "1080-1089",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vdi3.html#TT239923"}
@article{bb245016,
AUTHOR = "Tamaazousti, Y. and Le Borgne, H. and Popescu, A. and Gadeski, E. and Ginsca, A. and Hudelot, C.",
TITLE = "Vision-language integration using constrained local semantic features",
JOURNAL = CVIU,
VOLUME = "163",
YEAR = "2017",
NUMBER = "1",
PAGES = "41-57",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239924"}
@article{bb245017,
AUTHOR = "Zhu, Y.Q. and Li, X.Y. and Zheng, M. and Yang, J.H. and Wang, Z.H. and Guo, X.Q. and Chai, Z.F. and Yuan, Y.C. and Jiang, S.Q.",
TITLE = "Focus and Align: Learning Tube Tokens for Video-Language Pre-Training",
JOURNAL = MultMed,
VOLUME = "25",
YEAR = "2023",
PAGES = "8036-8050",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239925"}
@article{bb245018,
AUTHOR = "Wu, W.H. and Sun, Z. and Song, Y.X. and Wang, J.D. and Ouyang, W.L.",
TITLE = "Transferring Vision-Language Models for Visual Recognition:
A Classifier Perspective",
JOURNAL = IJCV,
VOLUME = "132",
YEAR = "2024",
NUMBER = "2",
MONTH = "February",
PAGES = "392-409",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239926"}
@article{bb245019,
AUTHOR = "Ming, Y.F. and Li, Y.X.",
TITLE = "How Does Fine-Tuning Impact Out-of-Distribution Detection for
Vision-Language Models?",
JOURNAL = IJCV,
VOLUME = "132",
YEAR = "2024",
NUMBER = "2",
MONTH = "February",
PAGES = "596-609",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239927"}
@article{bb245020,
AUTHOR = "Zhao, C.R. and Wang, Y. and Jiang, X.Y. and Shen, Y.F. and Song, K. and Li, D.S. and Miao, D.Q.",
TITLE = "Learning Domain Invariant Prompt for Vision-Language Models",
JOURNAL = IP,
VOLUME = "33",
YEAR = "2024",
PAGES = "1348-1360",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239928"}
@article{bb245021,
AUTHOR = "Yang, X.F. and Liu, F. and Lin, G.S.",
TITLE = "Neural Logic Vision Language Explainer",
JOURNAL = MultMed,
VOLUME = "26",
YEAR = "2024",
PAGES = "3331-3340",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239929"}
@article{bb245022,
AUTHOR = "Wang, Y.D. and Yu, Z.O. and Wang, J.D. and Heng, Q. and Chen, H. and Ye, W. and Xie, R. and Xie, X. and Zhang, S.K.",
TITLE = "Exploring Vision-Language Models for Imbalanced Learning",
JOURNAL = IJCV,
VOLUME = "132",
YEAR = "2024",
NUMBER = "1",
MONTH = "January",
PAGES = "224-237",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239930"}
@article{bb245023,
AUTHOR = "Zeng, Y. and Zhang, X. and Li, H. and Wang, J.W. and Zhang, J.P. and Zhou, W.",
TITLE = "X2-VLM: All-in-One Pre-Trained Model for Vision-Language Tasks",
JOURNAL = PAMI,
VOLUME = "46",
YEAR = "2024",
NUMBER = "5",
MONTH = "May",
PAGES = "3156-3168",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239931"}
@article{bb245024,
AUTHOR = "Kong, D. and Kong, K. and Kang, S.J.",
TITLE = "Image clustering using generated text centroids",
JOURNAL = SP:IC,
VOLUME = "125",
YEAR = "2024",
PAGES = "117128",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239932"}
@article{bb245025,
AUTHOR = "Chen, X.Y. and Yang, J.H. and Chen, S. and Wang, L. and Jiang, M. and Zhao, Q.",
TITLE = "Every Problem, Every Step, All in Focus: Learning to Solve
Vision-Language Problems With Integrated Attention",
JOURNAL = PAMI,
VOLUME = "46",
YEAR = "2024",
NUMBER = "7",
MONTH = "July",
PAGES = "4720-4735",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239933"}
@article{bb245026,
AUTHOR = "Menon, S. and Chandratreya, I.P. and Vondrick, C.",
TITLE = "Task Bias in Contrastive Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "132",
YEAR = "2024",
NUMBER = "6",
MONTH = "June",
PAGES = "2026-2040",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239934"}
@article{bb245027,
AUTHOR = "Zhang, J.Y. and Huang, J.X. and Jin, S. and Lu, S.J.",
TITLE = "Vision-Language Models for Vision Tasks: A Survey",
JOURNAL = PAMI,
VOLUME = "46",
YEAR = "2024",
NUMBER = "8",
MONTH = "August",
PAGES = "5625-5644",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239935"}
@article{bb245028,
AUTHOR = "Dong, M.P. and Li, F. and Li, Z.B. and Liu, X.",
TITLE = "Cluster prototype earth mover's distance adapters and
alignment-guided prompt learning for vision-language models",
JOURNAL = PR,
VOLUME = "156",
YEAR = "2024",
PAGES = "110861",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239936"}
@article{bb245029,
AUTHOR = "Liu, Y. and Pan, Y. and Yin, J.",
TITLE = "Enhancing Multi-Label Deep Hashing for Image and Audio With Joint
Internal Global Loss Constraints and Large Vision-Language Model",
JOURNAL = SPLetters,
VOLUME = "31",
YEAR = "2024",
PAGES = "2550-2554",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239937"}
@article{bb245030,
AUTHOR = "Zhan, C.L. and Zhang, Y.F. and Lin, Y. and Wang, G.A. and Wang, H.W.",
TITLE = "UniDCP: Unifying Multiple Medical Vision-Language Tasks via Dynamic
Cross-Modal Learnable Prompts",
JOURNAL = MultMed,
VOLUME = "26",
YEAR = "2024",
PAGES = "9736-9748",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239938"}
@article{bb245031,
AUTHOR = "Su, K. and Zhang, X.X. and Zhang, S.Y. and Zhu, J. and Zhang, B.",
TITLE = "To Boost Zero-Shot Generalization for Embodied Reasoning With
Vision-Language Pre-Training",
JOURNAL = IP,
VOLUME = "33",
YEAR = "2024",
PAGES = "5370-5381",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239939"}
@article{bb245032,
AUTHOR = "Xuan, S.Y. and Yang, M. and Zhang, S.L.",
TITLE = "Adapting Vision-Language Models via Learning to Inject Knowledge",
JOURNAL = IP,
VOLUME = "33",
YEAR = "2024",
PAGES = "5798-5809",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239940"}
@article{bb245033,
AUTHOR = "Zhou, W. and Zhou, Z.H.",
TITLE = "Unsupervised Domain Adaption Harnessing Vision-Language Pre-Training",
JOURNAL = CirSysVideo,
VOLUME = "34",
YEAR = "2024",
NUMBER = "9",
MONTH = "September",
PAGES = "8201-8214",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239941"}
@article{bb245034,
AUTHOR = "Guo, M.H. and Zhang, Y. and Mu, T.J. and Huang, S.X. and Hu, S.M.",
TITLE = "Tuning Vision-Language Models With Multiple Prototypes Clustering",
JOURNAL = PAMI,
VOLUME = "46",
YEAR = "2024",
NUMBER = "12",
MONTH = "December",
PAGES = "11186-11199",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239942"}
@article{bb245035,
AUTHOR = "Sun, B. and Wu, Z.C. and Zhang, H. and He, J.",
TITLE = "VTPL: Visual and text prompt learning for visual-language models",
JOURNAL = JVCIR,
VOLUME = "104",
YEAR = "2024",
PAGES = "104280",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239943"}
@article{bb245036,
AUTHOR = "Liu, L.C. and Wang, N.N. and Liu, D. and Yang, X. and Gao, X.B. and Liu, T.L.",
TITLE = "Towards Specific Domain Prompt Learning via Improved Text Label
Optimization",
JOURNAL = MultMed,
VOLUME = "26",
YEAR = "2024",
PAGES = "10805-10815",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239944"}
@article{bb245037,
AUTHOR = "Liu, X. and Wu, J. and Yang, W.F. and Zhou, X. and Zhang, T.Z.",
TITLE = "Multi-Modal Attribute Prompting for Vision-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "34",
YEAR = "2024",
NUMBER = "11",
MONTH = "November",
PAGES = "11579-11591",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239945"}
@article{bb245038,
AUTHOR = "Jiang, H.J. and Zhang, J.K. and Huang, R. and Ge, C.J. and Ni, Z. and Song, S. and Huang, G.",
TITLE = "Cross-modal adapter for vision-language retrieval",
JOURNAL = PR,
VOLUME = "159",
YEAR = "2025",
PAGES = "111144",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239946"}
@article{bb245039,
AUTHOR = "Yellinek, N. and Karlinsky, L. and Giryes, R.",
TITLE = "3VL: Using Trees to Improve Vision-Language Models' Interpretability",
JOURNAL = IP,
VOLUME = "34",
YEAR = "2025",
PAGES = "495-509",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239947"}
@article{bb245040,
AUTHOR = "Yang, L.F. and Li, X. and Wang, Y.Z. and Wang, X.L. and Yang, J.",
TITLE = "Fine-Grained Visual Text Prompting",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "3",
MONTH = "March",
PAGES = "1594-1609",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239948"}
@article{bb245041,
AUTHOR = "Wang, F. and Han, Z.Y. and Liu, X. and Yin, Y.L. and Gao, X.",
TITLE = "CTPT: Continual Test-time Prompt Tuning for vision-language models",
JOURNAL = PR,
VOLUME = "161",
YEAR = "2025",
PAGES = "111300",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239949"}
@article{bb245042,
AUTHOR = "Liang, N. and Liu, Y.",
TITLE = "DPO: Discrete Prompt Optimization for Vision-Language Models",
JOURNAL = SPLetters,
VOLUME = "32",
YEAR = "2025",
PAGES = "671-675",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239950"}
@article{bb245043,
AUTHOR = "Ondeng, O. and Ouma, H. and Akuon, P.",
TITLE = "Enriching visual feature representations for vision-language tasks
using spectral transforms",
JOURNAL = IVC,
VOLUME = "154",
YEAR = "2025",
PAGES = "105390",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239951"}
@article{bb245044,
AUTHOR = "Xu, C. and Zhu, Y.H. and Shen, H.C. and Chen, B.H. and Liao, Y.X. and Chen, X.X. and Wang, L.M.",
TITLE = "Progressive Visual Prompt Learning with Contrastive Feature
Re-formation",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "2",
MONTH = "February",
PAGES = "511-526",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239952"}
@article{bb245045,
AUTHOR = "Long, S. and Zhao, Z. and Yuan, J.K. and Tan, Z.C. and Liu, J.J. and Feng, J.Y. and Wang, S.S. and Wang, J.D.",
TITLE = "Mutual Prompt Leaning for Vision Language Models",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "3",
MONTH = "March",
PAGES = "1258-1276",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239953"}
@article{bb245046,
AUTHOR = "Yin, J.H. and Zhang, X.Y. and Wu, L. and Wang, X.J.",
TITLE = "Context-aware prompt learning for test-time vision recognition with
frozen vision-language model",
JOURNAL = PR,
VOLUME = "162",
YEAR = "2025",
PAGES = "111359",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239954"}
@article{bb245047,
AUTHOR = "Chen, Y. and Zhang, S. and Sun, Y. and Yang, J. and Liang, W.J. and Wang, H.R.",
TITLE = "Artificial-Spiking Hierarchical Networks for Vision-Language
Representation Learning",
JOURNAL = CirSysVideo,
VOLUME = "35",
YEAR = "2025",
NUMBER = "3",
MONTH = "March",
PAGES = "2768-2781",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239955"}
@article{bb245048,
AUTHOR = "Li, B.Z. and Wang, S.R. and Wang, S.Q. and Ye, Y.",
TITLE = "High Efficiency Image Compression for Large Visual-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "35",
YEAR = "2025",
NUMBER = "3",
MONTH = "March",
PAGES = "2870-2880",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239956"}
@article{bb245049,
AUTHOR = "Liu, L.C. and Wang, N.N. and Zhou, D.W. and Liu, D.C. and Yang, X. and Gao, X.B. and Liu, T.L.",
TITLE = "Generalizable Prompt Learning via Gradient Constrained
Sharpness-Aware Minimization",
JOURNAL = MultMed,
VOLUME = "27",
YEAR = "2025",
PAGES = "1100-1113",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239957"}
@article{bb245050,
AUTHOR = "Lu, Z. and Bai, J. and Li, X. and Xiao, Z. and Wang, X.C.",
TITLE = "Task-to-Instance Prompt Learning for Vision-Language Models at Test
Time",
JOURNAL = IP,
VOLUME = "34",
YEAR = "2025",
PAGES = "1908-1920",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239958"}
@article{bb245051,
AUTHOR = "Fang, Z.Q. and Yuan, Z.H. and Li, Z.Y. and Chen, J.Y. and Kuang, K. and Yao, Y.F. and Wu, F.",
TITLE = "Cross-Modality Image Interpretation via Concept Decomposition Vector
of Visual-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "35",
YEAR = "2025",
NUMBER = "4",
MONTH = "April",
PAGES = "3024-3038",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239959"}
@article{bb245052,
AUTHOR = "Ramzi, E. and Audebert, N. and Rambour, C. and Araujo, A. and Bitot, X. and Thome, N.",
TITLE = "Optimization of Rank Losses for Image Retrieval",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "6",
MONTH = "June",
PAGES = "4317-4329",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239960"}
@inproceedings{bb245053,
AUTHOR = "Lafon, M. and Ramzi, E. and Rambour, C. and Audebert, N. and Thome, N.",
TITLE = "Gallop: Learning Global and Local Prompts for Vision-language Models",
BOOKTITLE = ECCV24,
YEAR = "2024",
PAGES = "LXI: 264-282",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239961"}
@article{bb245054,
AUTHOR = "Liu, K.C. and Wang, C.Q. and Han, X.D. and Liu, Y.J. and Chen, B.Q.",
TITLE = "Generalized Robot Vision-Language Model via Linguistic Foreground-Aware
Contrast",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "6",
MONTH = "June",
PAGES = "3481-3518",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239962"}
@article{bb245055,
AUTHOR = "Chen, B.Q. and Liu, Y.J. and Han, X.D. and Wang, C.Q. and Liu, K.C.",
TITLE = "Generalized Robot Vision-Language Model via Linguistic Foreground-Aware
Contrast",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "7",
MONTH = "July",
PAGES = "4971-4971",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239962"}
@article{bb245056,
AUTHOR = "Yang, L.X. and Zhang, R.Y. and Chen, Q. and Xie, X.H.",
TITLE = "Learning with Enriched Inductive Biases for Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "6",
MONTH = "June",
PAGES = "3746-3761",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239963"}
@article{bb245057,
AUTHOR = "Yao, H.T. and Zhang, R. and Lyu, H.H. and Zhang, Y.D. and Xu, C.S.",
TITLE = "Bi-Modality Individual-Aware Prompt Tuning for Visual-Language Model",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "8",
MONTH = "August",
PAGES = "6352-6368",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239964"}
@inproceedings{bb245058,
AUTHOR = "Yao, H.T. and Zhang, R. and Xu, C.S.",
TITLE = "TCP: Textual-Based Class-Aware Prompt Tuning for Visual-Language
Model",
BOOKTITLE = CVPR24,
YEAR = "2024",
PAGES = "23438-23448",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239965"}
@article{bb245059,
AUTHOR = "Hao, Z.W. and Guo, J.Y. and Shen, L. and Luo, Y. and Hu, H. and Wen, Y.G.",
TITLE = "ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language
Tuning",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "8",
MONTH = "August",
PAGES = "5527-5543",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239966"}
@article{bb245060,
AUTHOR = "Zeng, R.F. and Yang, Z.P. and Yu, R.Y. and Zhang, Y.G.",
TITLE = "Supplementary Prompt Learning for Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "8",
MONTH = "August",
PAGES = "5822-5839",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239967"}
@article{bb245061,
AUTHOR = "Liu, K.C. and Liu, Y.J. and Chen, B.Q.",
TITLE = "General 3D Vision-Language Model With Fast Rendering and Pre-Training
Vision-Language Alignment",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "9",
MONTH = "September",
PAGES = "7352-7368",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239968"}
@article{bb245062,
AUTHOR = "Gao, Y.S. and Zhu, Z.X. and Wang, S.S.",
TITLE = "Mixture of coarse and fine-grained prompt tuning for vision-language
model",
JOURNAL = PR,
VOLUME = "170",
YEAR = "2026",
PAGES = "112074",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239969"}
@article{bb245063,
AUTHOR = "Hao, F.S. and Liu, L. and Wu, F.X. and Zhang, Q.S. and Cheng, J.",
TITLE = "Textual Embeddings are Good Class-Aware Visual Prompts for Adapting
Vision-Language Models",
JOURNAL = SPLetters,
VOLUME = "32",
YEAR = "2025",
PAGES = "2992-2996",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239970"}
@article{bb245064,
AUTHOR = "Liu, J. and Lu, Z.Q. and Luo, H. and Lu, Z.M. and Zheng, Y.M.",
TITLE = "Progressive Multi-Prompt Learning for Vision-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "35",
YEAR = "2025",
NUMBER = "10",
MONTH = "October",
PAGES = "9562-9574",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239971"}
@article{bb245065,
AUTHOR = "Wang, W.X. and He, X.J. and Zhang, Y. and Guo, L.T. and Shen, J.C. and Li, J.Y. and Liu, J.",
TITLE = "CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring
Image Segmentation",
JOURNAL = MultMed,
VOLUME = "26",
YEAR = "2024",
PAGES = "6906-6916",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239972"}
@article{bb245066,
AUTHOR = "Zhang, E. and Zhu, B. and Chen, Y.Y. and Miao, Q.H. and Tang, M. and Wang, J.Q.",
TITLE = "Optimization of Prompt Learning via Multi-Knowledge Representation
for Vision-Language Models",
JOURNAL = MultMed,
VOLUME = "27",
YEAR = "2025",
PAGES = "7557-7569",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239973"}
@article{bb245067,
AUTHOR = "Park, K.Y. and An, S. and Lee, Y.J. and Kim, D.H.",
TITLE = "Learning Compositionality from Multifaceted Synthetic Data for
Language-based Object Detection",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "11",
MONTH = "November",
PAGES = "7873-7896",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239974"}
@inproceedings{bb245068,
AUTHOR = "Park, K.Y. and Saito, K. and Kim, D.H.",
TITLE = "Weak-to-strong Compositional Learning from Generative Models for
Language-based Object Detection",
BOOKTITLE = ECCV24,
YEAR = "2024",
PAGES = "XXIII: 1-19",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239975"}
@article{bb245069,
AUTHOR = "Sarto, S. and Moratelli, N. and Cornia, M. and Baraldi, L. and Cucchiara, R.",
TITLE = "Positive-Augmented Contrastive Learning for Vision-and-Language
Evaluation and Training",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "11",
MONTH = "November",
PAGES = "7647-7671",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239976"}
@inproceedings{bb245070,
AUTHOR = "Stefanini, M. and Cornia, M. and Baraldi, L. and Cucchiara, R.",
TITLE = "A Novel Attention-based Aggregation Function to Combine Vision and
Language",
BOOKTITLE = ICPR21,
YEAR = "2021",
PAGES = "1212-1219",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239977"}
@article{bb245071,
AUTHOR = "Liu, L.C. and Wang, N.N. and Chen, C. and Liu, D. and Yang, X. and Gao, X.B. and Liu, T.L.",
TITLE = "Frequency-Based Comprehensive Prompt Learning for Vision-Language
Models",
JOURNAL = PAMI,
VOLUME = "47",
YEAR = "2025",
NUMBER = "12",
MONTH = "December",
PAGES = "11974-11989",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239978"}
@article{bb245072,
AUTHOR = "Yang, X. and Zhong, X.Y. and Wang, N.N.",
TITLE = "Distribution-Aware Prompt Learning for Vision-Language Models With
Dynamic Boundary Prototype",
JOURNAL = IP,
VOLUME = "35",
YEAR = "2026",
PAGES = "3537-3549",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239979"}
@article{bb245073,
AUTHOR = "Li, J.C. and Gao, M. and Tang, S.L. and Wei, L.H. and Xiao, J. and Wu, F. and Hong, R.C. and Wang, M. and Tian, Q.",
TITLE = "Structure-Induced Gradient Regulation for Generalizable
Vision-Language Models",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "219-235",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239980"}
@inproceedings{bb245074,
AUTHOR = "Li, J.C. and Gao, M. and Wei, L.H. and Tang, S.L. and Zhang, W.Q. and Li, M.Z. and Ji, W. and Tian, Q. and Chua, T.S. and Zhuang, Y.T.",
TITLE = "Gradient-Regulated Meta-Prompt Learning for Generalizable
Vision-Language Models",
BOOKTITLE = ICCV23,
YEAR = "2023",
PAGES = "2551-2562",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239981"}
@article{bb245075,
AUTHOR = "Xiao, Y.S. and Liu, X.L. and Cheng, Q.J. and Yin, Z.F. and Liang, S.Y. and Li, J.P. and Shao, J. and Liu, A.S. and Tao, D.C.",
TITLE = "GenderBias-VL: Benchmarking Gender Bias in Vision Language Models via
Counterfactual Probing",
JOURNAL = IJCV,
VOLUME = "133",
YEAR = "2025",
NUMBER = "12",
MONTH = "December",
PAGES = "8332-8355",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239982"}
@article{bb245076,
AUTHOR = "Chen, T.Y. and Ai, J.L.",
TITLE = "Hierarchical Prompt Engineering for Remote Sensing Scene
Understanding with Large Vision-Language Models",
JOURNAL = RS,
VOLUME = "17",
YEAR = "2025",
NUMBER = "22",
PAGES = "3727",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239983"}
@article{bb245077,
AUTHOR = "Xu, X. and Qin, L. and Che, W. and Kan, M.Y.",
TITLE = "Manager: Aggregating Insights From Unimodal Experts in Two-Tower VLMs
and MLLMs",
JOURNAL = CirSysVideo,
VOLUME = "35",
YEAR = "2025",
NUMBER = "12",
MONTH = "December",
PAGES = "12278-12291",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239984"}
@article{bb245078,
AUTHOR = "Kim, G. and Kim, S. and Lee, S.",
TITLE = "Decoupling augmentation bias in prompt learning for vision-language
models",
JOURNAL = PR,
VOLUME = "172",
YEAR = "2026",
PAGES = "112630",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239985"}
@inproceedings{bb245079,
AUTHOR = "Kim, G. and Kim, S. and Lee, S.",
TITLE = "AAPL: Adding Attributes to Prompt Learning for Vision-Language Models",
BOOKTITLE = Prompting24,
YEAR = "2024",
PAGES = "1572-1582",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239986"}
@article{bb245080,
AUTHOR = "Guo, Y.C. and Gu, X.D.",
TITLE = "MMRL++: Parameter-Efficient and Interaction-Aware Representation
Learning for Vision-Language Models",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "11",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239987"}
@inproceedings{bb245081,
AUTHOR = "Guo, Y.C. and Gu, X.D.",
TITLE = "MMRL: Multi-Modal Representation Learning for Vision-Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "25015-25025",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239988"}
@article{bb245082,
AUTHOR = "Ye, W.X. and Wang, W. and Liu, Y.H. and Song, Y. and Ren, B. and Bi, W. and Cucchiara, R. and Sebe, N.",
TITLE = "A Unified Masked Jigsaw Puzzle Framework for Vision and Language
Models",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "2",
MONTH = "February",
PAGES = "1873-1887",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239989"}
@article{bb245083,
AUTHOR = "Wang, Z.Y. and Liu, L. and Wan, G. and Lu, Y.C. and Zheng, F.J. and Sun, G. and Huang, Y.X. and Guo, S.H. and Li, X. and Yuan, L.",
TITLE = "SAREval: A Multi-Dimensional and Multi-Task Benchmark for Evaluating
Visual Language Models on SAR Image Understanding",
JOURNAL = RS,
VOLUME = "18",
YEAR = "2026",
NUMBER = "1",
PAGES = "82",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239990"}
@article{bb245084,
AUTHOR = "Wu, J.F. and Jiang, Y. and Ma, C.F. and Liu, Y.L. and Zhao, H.S. and Yuan, Z.H. and Bai, S. and Bai, X.",
TITLE = "Liquid: Language Models are Scalable and Unified Multi-Modal Generators",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "1",
MONTH = "January",
PAGES = "39",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239991"}
@article{bb245085,
AUTHOR = "Su, Y.L. and Liu, X.L. and Huang, Z. and Zhao, Y.W. and Hong, R.C. and Wang, M.",
TITLE = "AttriPrompt: Class Attribute-Aware Prompt Tuning for Vision-Language
Model",
JOURNAL = IP,
VOLUME = "35",
YEAR = "2026",
PAGES = "1395-1407",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239992"}
@article{bb245086,
AUTHOR = "Li, Y.W. and Zhang, Y.C. and Wang, C.Y. and Zhong, Z.S. and Chen, Y.X. and Chu, R. and Liu, S. and Jia, J.Y.",
TITLE = "Mini-Gemini: Mining the Potential of Multi-Modality Vision Language
Models",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "3",
MONTH = "March",
PAGES = "3530-3543",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239993"}
@article{bb245087,
AUTHOR = "Xu, N. and Yao, K. and Yang, R. and Li, C.",
TITLE = "Visual-language active search for wide-area remote sensing imagery",
JOURNAL = PR,
VOLUME = "175",
YEAR = "2026",
PAGES = "113106",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239994"}
@article{bb245088,
AUTHOR = "Chen, Y. and Fu, S. and Zhang, Y.",
TITLE = "MoPD: Mixture-of-Prompts Distillation for Vision-Language Models",
JOURNAL = MultMed,
VOLUME = "28",
YEAR = "2026",
PAGES = "1943-1954",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239995"}
@article{bb245089,
AUTHOR = "Qi, Y. and Li, H.X. and Song, Y.Q. and Wu, X.X. and Luo, J.B.",
TITLE = "How Vision-Language Tasks Benefit From Large Pre-Trained Models:
A Survey",
JOURNAL = MultMed,
VOLUME = "28",
YEAR = "2026",
PAGES = "1188-1210",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239996"}
@article{bb245090,
AUTHOR = "Lee, J.J.",
TITLE = "Language-guided invariance probing of vision-language models",
JOURNAL = PRL,
VOLUME = "202",
YEAR = "2026",
PAGES = "108-113",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239997"}
@article{bb245091,
AUTHOR = "Zhang, Y. and Bian, S. and Liu, J. and Song, R.J. and Zhu, D. and Zhang, C.H. and Hua, C.C.",
TITLE = "Robot Active Task Cognition:
Situation-Aware Task Planning With Large Language Models",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "4",
MONTH = "April",
PAGES = "4722-4733",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239998"}
@article{bb245092,
AUTHOR = "Zhao, X.Y. and Li, X.T. and Duan, H.D. and Huang, H. and Li, Y. and Chen, K. and Yang, H.",
TITLE = "MG-LLaVA: Toward Multi-Granularity Visual Instruction Tuning",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "4",
MONTH = "April",
PAGES = "4464-4478",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT239999"}
@article{bb245093,
AUTHOR = "Zhang, J.M. and Wang, X. and Ma, X.J. and Qiu, L.Y. and Jiang, Y.G. and Sang, J.",
TITLE = "NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust
Vision-Language Models",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "6",
MONTH = "June",
PAGES = "6615-6627",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240000"}
@inproceedings{bb245094,
AUTHOR = "Wang, X. and Chen, K. and Zhang, J.M. and Chen, J.J. and Ma, X.J.",
TITLE = "TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in
Vision-Language Models",
BOOKTITLE = CVPR25,
YEAR = "2025",
PAGES = "19910-19920",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240001"}
@article{bb245095,
AUTHOR = "Yin, J.H. and Pu, N. and Zhang, X.Y. and Yang, L.F. and Wu, L. and Wang, X.J. and Zhong, Z.",
TITLE = "Plug-and-play Class-aware Knowledge Injection for Prompt Learning with
Visual-Language Model",
JOURNAL = IJCV,
VOLUME = "134",
YEAR = "2026",
NUMBER = "6",
MONTH = "June",
PAGES = "254",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240002"}
@article{bb245096,
AUTHOR = "Yang, J.H. and Jiang, M. and Zhao, Q.",
TITLE = "Defying Distractions in Multimodal Tasks: A Novel Benchmark for Large
Vision-Language Models",
JOURNAL = PAMI,
VOLUME = "48",
YEAR = "2026",
NUMBER = "6",
MONTH = "June",
PAGES = "6314-6331",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240003"}
@article{bb245097,
AUTHOR = "Wang, X.W.",
TITLE = "TriFusion-RL: Integrating task verifiers, self-feedback, and
perceptual tools for vision-language models",
JOURNAL = CVIU,
VOLUME = "268",
YEAR = "2026",
PAGES = "104764",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240004"}
@article{bb245098,
AUTHOR = "Liu, X. and Lan, N. and Wei, M.J. and Xie, X.M. and Shi, G.M.",
TITLE = "SceneReasoner: Sufficient Embodied Scene Understanding From Limited
Perception by Explicit Functional Association",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "5",
MONTH = "May",
PAGES = "6456-6471",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240005"}
@article{bb245099,
AUTHOR = "Wang, G.Q. and Zhao, P. and Wang, X. and Guo, H.R. and Qi, N. and Yang, S. and Guo, Q.H.",
TITLE = "DHPT: Dual-Modality Heterogeneous Prompt Tuning for Online Test-Time
Adaption in Vision-Language Models",
JOURNAL = CirSysVideo,
VOLUME = "36",
YEAR = "2026",
NUMBER = "6",
MONTH = "June",
PAGES = "8590-8601",
BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vlm3.html#TT240006"}
Last update:Aug 19, 2026 at 13:26:35