@article{bb245900,
        AUTHOR = "Zhu, Z.H. and Huang, Y.F. and Zhang, M.F. and Ouyang, L.Y. and Sato, Y.",
        TITLE = "Prompt-Augmented Boundary Attentive Learning for Weakly Supervised
Temporal Sentence Grounding",
        JOURNAL = CirSysVideo,
        VOLUME = "35",
        YEAR = "2025",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "11404-11415",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240806"}

@inproceedings{bb245901,
        AUTHOR = "Huang, Y.F. and Yang, L. and Sato, Y.",
        TITLE = "Weakly Supervised Temporal Sentence Grounding with Uncertainty-Guided
Self-training",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "18908-18918",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240807"}

@article{bb245902,
        AUTHOR = "Xu, X.X. and Yuan, Y.T. and Zhang, Q.D. and Wu, W.H. and Jie, Z.Q. and Ma, L. and Wang, X.",
        TITLE = "Weakly-Supervised 3D Visual Grounding Based on Visual Language
Alignment",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "7662-7674",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240808"}

@inproceedings{bb245903,
        AUTHOR = "Liu, Y.F. and Wan, B. and Ma, L. and He, X.M.",
        TITLE = "Relation-aware Instance Refinement for Weakly Supervised Visual
Grounding",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "5608-5617",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240809"}

@article{bb245904,
        AUTHOR = "Dai, M. and Cheng, W.X. and Liu, J.J. and Yang, L.F. and Feng, Z.H. and Yang, W.K. and Wang, J.D.",
        TITLE = "Improving Generalized Visual Grounding With Instance-Aware Joint
Learning",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "1",
        MONTH = "January",
        PAGES = "448-465",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240810"}

@article{bb245905,
        AUTHOR = "Zhu, Y. and Chen, D. and Wang, H. and Jia, T. and Deng, S.Z.",
        TITLE = "DCART: A dual contrastive alignment residual transformer model for
visual grounding",
        JOURNAL = PR,
        VOLUME = "172",
        YEAR = "2026",
        PAGES = "112688",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240811"}

@article{bb245906,
        AUTHOR = "Shi, L.T. and Liu, T. and Hu, X.T. and Hu, Y. and Yin, Q. and Hong, R.C.",
        TITLE = "SwimVG: Step-Wise Multimodal Fusion and Adaption for Visual Grounding",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "9776-9787",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240812"}

@article{bb245907,
        AUTHOR = "Fu, Z. and Mao, Z.D. and Zhang, L. and Zhang, Y.D.",
        TITLE = "Boosting Faithful Multi-Modal LLMs via Complementary Visual Grounding",
        JOURNAL = IP,
        VOLUME = "34",
        YEAR = "2025",
        PAGES = "8641-8655",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240813"}

@article{bb245908,
        AUTHOR = "Hu, M. and Yang, K. and Li, J.",
        TITLE = "Text-Injected Discriminative Model for Remote Sensing Visual
Grounding",
        JOURNAL = RS,
        VOLUME = "18",
        YEAR = "2026",
        NUMBER = "1",
        PAGES = "161",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240814"}

@article{bb245909,
        AUTHOR = "Xiao, L.H. and Yang, X.S. and Lan, X.Y. and Wang, Y.W. and Xu, C.S.",
        TITLE = "Toward Visual Grounding: A Survey",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "2749-2771",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240815"}

@article{bb245910,
        AUTHOR = "Zhou, Y. and Chen, J. and Zhang, Z. and Huang, P.H. and Ding, R. and Zou, Z.T. and Gao, P. and Wei, Y.C. and Li, K. and Yang, X. and Jiang, X. and Yang, H.X. and Li, J.",
        TITLE = "DVGBench: Implicit-to-explicit visual grounding benchmark in UAV
imagery with large vision-language models",
        JOURNAL = PandRS,
        VOLUME = "232",
        YEAR = "2026",
        PAGES = "831-847",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240816"}

@article{bb245911,
        AUTHOR = "Ren, Y.L. and Du, J.Y. and Liu, X. and Su, Q.X. and Deng, Y. and Li, H.J.",
        TITLE = "MTRAG: Multi-Target Referring and Grounding via Hybrid
Semantic-Spatial Integration",
        JOURNAL = IP,
        VOLUME = "35",
        YEAR = "2026",
        PAGES = "2167-2181",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240817"}

@article{bb245912,
        AUTHOR = "Dai, M. and Chen, K. and Cheng, W.X. and Zhuang, J. and Feng, Z.H. and Zhu, P.F. and Yang, W.K.",
        TITLE = "GC3VG: Generalized Multi-Task Visual Grounding With Coarse-to-Fine
Consistency Constraints",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "4827-4841",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240818"}

@article{bb245913,
        AUTHOR = "Hu, C.X. and Wen, X.B. and Zhao, Y. and Ma, C.J. and Guan, W. and Wang, R. and Gao, Z.",
        TITLE = "EFIN: A Novel Enhanced Feature Interaction Network for Temporal
Sentence Grounding in Videos",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "3518-3531",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240819"}

@article{bb245914,
        AUTHOR = "Tang, W. and Sun, Y.P. and Gu, Q.Y. and Li, Z.C.",
        TITLE = "Visual Position Prompt for MLLM Based Visual Grounding",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "3739-3754",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240820"}

@article{bb245915,
        AUTHOR = "Chai, J.M. and Jiao, L.C. and Lu, X.Q. and Li, L.L. and Liu, F. and Sun, L. and Liu, X. and Ma, W.P. and Li, W.B.",
        TITLE = "Like Human Rethinking: Contour Transformer AutoRegression for
Referring Remote Sensing Interpretation",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "6174-6191",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240821"}

@article{bb245916,
        AUTHOR = "Oliveira, D.A.P. and Teodoro, L. and de Matos, D.M.",
        TITLE = "GroundCap: A visually grounded image captioning dataset with object
and action identification",
        JOURNAL = PR,
        VOLUME = "179",
        YEAR = "2026",
        PAGES = "113703",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240822"}

@article{bb245917,
        AUTHOR = "Zhang, Y.C. and Bian, S. and Li, J.H. and Lin, J. and Wang, F.Y. and Xie, Y. and Xie, Y. and Qu, Y.Y.",
        TITLE = "Instructing visual feature modeling with semantic guidance for 3D
visual grounding",
        JOURNAL = PR,
        VOLUME = "179",
        YEAR = "2026",
        PAGES = "113896",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240823"}

@article{bb245918,
        AUTHOR = "Liu, Y. and Zhang, J.H. and Wu, Y. and Zhao, Z.J. and Chen, Q.C. and Peng, Y.X.",
        TITLE = "Confidence-Aware Pseudo-Label Self-Correction for Weakly Supervised
Visual Grounding",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "8901-8918",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240824"}

@inproceedings{bb245919,
        AUTHOR = "Liu, Y. and Zhang, J.H. and Chen, Q.C. and Peng, Y.X.",
        TITLE = "Confidence-aware Pseudo-label Learning for Weakly Supervised Visual
Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2816-2826",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240825"}

@article{bb245920,
        AUTHOR = "Guo, P. and Zhu, H.Y. and Ye, H.C. and Yang, Y.H. and Yin, F. and Chen, T.",
        TITLE = "Rendered 2D Semantic and Generative Priors Guided 3D Multi-Object
Grounding",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "5809-5820",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240826"}

@article{bb245921,
        AUTHOR = "Li, H.B. and Xiao, L.H. and Zhao, Z. and Shen, Q. and Huang, Y.X. and Xiao, B. and Ma, Z.Y.",
        TITLE = "BARE: Towards Bias-Aware and Reasoning-Enhanced One-Tower Visual
Grounding",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "11111-11125",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240827"}

@article{bb245922,
        AUTHOR = "Shi, L.T. and Liu, T. and Xie, J.X. and Li, N. and Zhong, B. and Hong, R.C.",
        TITLE = "Text-Guided Vision Token Reduction With Low-Rank Adaptation for
Efficient Visual Grounding",
        JOURNAL = CirSysVideo,
        VOLUME = "36",
        YEAR = "2026",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "11391-11401",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240828"}

@article{bb245923,
        AUTHOR = "Zhu, S.Y. and Zhang, Z.H. and Wang, H. and Wang, Z.X.",
        TITLE = "Scene-verified negatives for selective 3D visual grounding",
        JOURNAL = PRL,
        VOLUME = "207",
        YEAR = "2026",
        PAGES = "42-46",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240829"}

@article{bb245924,
        AUTHOR = "Luo, H.C. and Zhai, W. and Wang, J. and Cao, Y. and Zha, Z.J.",
        TITLE = "Visual-Geometric Collaborative Guidance for Affordance Learning",
        JOURNAL = IJCV,
        VOLUME = "134",
        YEAR = "2026",
        NUMBER = "8",
        MONTH = "August",
        PAGES = "357",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240830"}

@inproceedings{bb245925,
        AUTHOR = "Iwakata, S. and Oshima, R. and Tsunashima, H. and Feng, Q. and Kataoka, H. and Morishima, S.",
        TITLE = "Viewpoint-Dependent 3D Visual Grounding for Mobile Robots",
        BOOKTITLE = ICIP25,
        YEAR = "2025",
        PAGES = "1690-1695",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240831"}

@inproceedings{bb245926,
        AUTHOR = "Zhao, H.R. and Chen, T.Y. and Wang, Z.",
        TITLE = "On the Robustness of GUI Grounding Models Against Image Attacks",
        BOOKTITLE = TrustworthyOpen25,
        YEAR = "2025",
        PAGES = "1609-1614",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240832"}

@inproceedings{bb245927,
        AUTHOR = "Zheng, Y.H. and Lin, G.S. and Chang, K.Y.",
        TITLE = "Transformer-based Visual Grounding with Inter-Modality Cross
Attention",
        BOOKTITLE = MVA25,
        YEAR = "2025",
        PAGES = "1-6",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240833"}

@inproceedings{bb245928,
        AUTHOR = "Lin, X.W. and Lin, T.W. and Huang, L.C. and Xie, H.Y. and Su, Z.Z.",
        TITLE = "BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "9007-9016",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240834"}

@inproceedings{bb245929,
        AUTHOR = "Chang, Y. and Fermoselle, L. and Ta, D. and Bucher, B. and Carlone, L. and Wang, J.",
        TITLE = "ASHiTA: Automatic Scene-Grounded HIerarchical Task Analysis",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "29458-29468",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240835"}

@inproceedings{bb245930,
        AUTHOR = "Yang, Y. and Yang, H. and Zhou, J.C. and Chen, P.H. and Zhang, H.X. and Du, Y.L. and Gan, C.",
        TITLE = "3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "17294-17303",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240836"}

@inproceedings{bb245931,
        AUTHOR = "Peng, Q.H. and Zheng, H. and Huang, G.",
        TITLE = "ProxyTransformation: Preshaping Point Cloud Manifold With Proxy
Attention For 3D Visual Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "24582-24592",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240837"}

@inproceedings{bb245932,
        AUTHOR = "Zong, Y.S. and Zhang, Q. and An, D.S. and Li, Z.H. and Xu, X. and Xu, L.H. and Tu, Z.W. and Xing, Y.F. and Dabeer, O.",
        TITLE = "Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "24635-24645",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240838"}

@inproceedings{bb245933,
        AUTHOR = "Wang, Y.X. and Wu, A. and Yang, M. and Min, Y. and Zhu, Y.H. and Deng, C.",
        TITLE = "Reasoning Mamba: Hypergraph-Guided Region Relation Calculating for
Weakly Supervised Affordance Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "27618-27627",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240839"}

@inproceedings{bb245934,
        AUTHOR = "Kim, C.D. and Moon, J. and Moon, S. and Yun, H. and Lee, S. and Kembhavi, A. and Lee, S. and Kim, G. and Lee, S.H. and Clark, C.",
        TITLE = "ReSpec: Relevance and Specificity Grounded Online Filtering for
Learning on Video-Text Data Streams",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "29040-29049",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240840"}

@inproceedings{bb245935,
        AUTHOR = "Deng, A.D. and Gao, Z. and Choudhuri, A. and Planche, B. and Zheng, M. and Wang, B. and Chen, T. and Chen, C. and Wu, Z.Y.",
        TITLE = "Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal
Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "13766-13775",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240841"}

@inproceedings{bb245936,
        AUTHOR = "Shao, Y.W. and Zhai, W. and Yang, Y.H. and Luo, H.C. and Cao, Y. and Zha, Z.J.",
        TITLE = "GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary
3D Object Affordance Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "17326-17336",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240842"}

@inproceedings{bb245937,
        AUTHOR = "Munasinghe, S. and Gani, H. and Zhu, W.Q. and Cao, J. and Xing, E. and Khan, F.S. and Khan, S.",
        TITLE = "VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual
Grounding in Videos",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "19036-19046",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240843"}

@inproceedings{bb245938,
        AUTHOR = "Garg, A. and Kumar, A. and Rawat, Y.S.",
        TITLE = "STPro: Spatial and Temporal Progressive Learning for Weakly
Supervised Spatio-Temporal Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "3384-3394",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240844"}

@inproceedings{bb245939,
        AUTHOR = "Vogel, F. and Bousselham, W. and Kukleva, A. and Shvetsova, N. and Kuehne, H.",
        TITLE = "VideoGEM: Training-Free Action Grounding in Videos",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "3374-3383",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240845"}

@inproceedings{bb245940,
        AUTHOR = "Wang, J.Y. and Chen, M.H. and Karaev, N. and Vedaldi, A. and Rupprecht, C. and Novotny, D.",
        TITLE = "VGGT: Visual Geometry Grounded Transformer",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "5294-5306",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240846"}

@inproceedings{bb245941,
        AUTHOR = "Li, R. and Li, S.J. and Kong, L.D. and Yang, X. and Liang, J.W.",
        TITLE = "SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual
Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "3707-3717",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240847"}

@inproceedings{bb245942,
        AUTHOR = "Guo, W.X. and Xu, X.W. and Wang, Z.W. and Feng, J.J. and Zhou, J. and Lu, J.W.",
        TITLE = "Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "3666-3675",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240848"}

@inproceedings{bb245943,
        AUTHOR = "Kukal, R. and Patravali, J. and Yu, F. and Singh, S. and Karianakis, N. and Madhok, R.",
        TITLE = "Click&Describe: Multimodal Grounding and Tracking for Aerial Objects",
        BOOKTITLE = WACV25,
        YEAR = "2025",
        PAGES = "6011-6021",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240849"}

@inproceedings{bb245944,
        AUTHOR = "Dey, S. and Unal, O. and Sakaridis, C. and Van Gool, L.J.",
        TITLE = "Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding",
        BOOKTITLE = WACV25,
        YEAR = "2025",
        PAGES = "4852-4861",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240850"}

@inproceedings{bb245945,
        AUTHOR = "Singhi, N. and Kim, J.M. and Roth, K. and Akata, Z.",
        TITLE = "Improving Intervention Efficacy via Concept Realignment in Concept
Bottleneck Models",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXVI: 422-438",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240851"}

@inproceedings{bb245946,
        AUTHOR = "Lee, P. and Byun, H.R.",
        TITLE = "BAM-DETR: Boundary-aligned Moment Detection Transformer for Temporal
Sentence Grounding in Videos",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "II: 220-238",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240852"}

@inproceedings{bb245947,
        AUTHOR = "Ma, C. and Jiang, Y. and Wu, J.N. and Yuan, Z.H. and Qi, X.J.",
        TITLE = "GROMA: Localized Visual Tokenization for Grounding Multimodal Large
Language Models",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "VI: 417-435",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240853"}

@inproceedings{bb245948,
        AUTHOR = "Huang, Z. and Satoh, S.",
        TITLE = "LOA-TRANS: Enhancing Visual Grounding by Location-aware Transformers",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "VII: 405-421",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240854"}

@inproceedings{bb245949,
        AUTHOR = "Zhu, C. and Wang, T. and Zhang, W.W. and Chen, K. and Liu, X.H.",
        TITLE = "SCANREASON: Empowering 3d Visual Grounding with Reasoning Capabilities",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "VIII: 151-168",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240855"}

@inproceedings{bb245950,
        AUTHOR = "Xiao, Z. and Gong, M. and Cascante Bonilla, P. and Zhang, X.Y. and Wu, J. and Ordonez, V.",
        TITLE = "Grounding Language Models for Visual Entity Recognition",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XI: 393-411",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240856"}

@inproceedings{bb245951,
        AUTHOR = "Cheng, Z.X. and Pu, Y.J. and Gong, S.G. and Kordjamshidi, P. and Kong, Y.",
        TITLE = "Shine: Saliency-aware Hierarchical Negative Ranking for Compositional
Temporal Grounding",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XIX: 398-416",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240857"}

@inproceedings{bb245952,
        AUTHOR = "Lee, P.Y. and Sung, M.",
        TITLE = "Reground: Improving Textual and Spatial Grounding at No Cost",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXIII: 275-292",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240858"}

@inproceedings{bb245953,
        AUTHOR = "Jiang, H.B. and Lu, Z.Q.",
        TITLE = "Visual Grounding for Object-level Generalization in Reinforcement
Learning",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXX: 55-72",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240859"}

@inproceedings{bb245954,
        AUTHOR = "Sun, P.L. and Song, Y.X. and Pan, X.L. and Kang, W.T. and Liu, G. and Shah, M. and Yan, Y.",
        TITLE = "SEGVG: Transferring Object Bounding Box to Segmentation for Visual
Grounding",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XXXVIII: 57-75",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240860"}

@inproceedings{bb245955,
        AUTHOR = "Kang, D. and Cho, M.",
        TITLE = "In Defense of Lazy Visual Grounding for Open-vocabulary Semantic
Segmentation",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLI: 143-164",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240861"}

@inproceedings{bb245956,
        AUTHOR = "Liu, Y. and He, J. and Li, W. and Kim, J. and Wei, D.L. and Pfister, H. and Chen, C.W.",
        TITLE = "R^1-tuning: Efficient Image-to-video Transfer Learning for Video
Temporal Grounding",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLI: 421-438",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240862"}

@inproceedings{bb245957,
        AUTHOR = "Zhang, H. and Li, H.Y. and Li, F. and Ren, T. and Zou, X. and Liu, S.L. and Huang, S.J. and Gao, J.F. and Zhang, L. and Li, C.Y. and Yang, J.W.",
        TITLE = "LLAVA-Grounding: Grounded Visual Chat with Large Multimodal Models",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLIII: 19-35",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240863"}

@inproceedings{bb245958,
        AUTHOR = "Yang, J. and Ding, R. and Brown, E. and Qi, X.J. and Xie, S.",
        TITLE = "V-IRL: Grounding Virtual Intelligence in Real Life",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLV: 36-55",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240864"}

@inproceedings{bb245959,
        AUTHOR = "Chen, W. and Chen, L. and Wu, Y.",
        TITLE = "An Efficient and Effective Transformer Decoder-based Framework for
Multi-task Visual Grounding",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLV: 125-141",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240865"}

@inproceedings{bb245960,
        AUTHOR = "Qian, Z.P. and Ma, Y.W. and Lin, Z.K. and Ji, J.Y. and Zheng, X. and Sun, X.S. and Ji, R.R.",
        TITLE = "Multi-branch Collaborative Learning Network for 3d Visual Grounding",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLVI: 381-398",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240866"}

@inproceedings{bb245961,
        AUTHOR = "Liu, S.L. and Zeng, Z.Y. and Ren, T. and Li, F. and Zhang, H. and Yang, J. and Jiang, Q. and Li, C.Y. and Yang, J.W. and Su, H. and Zhu, J. and Zhang, L.",
        TITLE = "Grounding Dino: Marrying Dino with Grounded Pre-training for Open-set
Object Detection",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "XLVII: 38-55",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240867"}

@inproceedings{bb245962,
        AUTHOR = "Leroy, V. and Cabon, Y. and Revaud, J.",
        TITLE = "Grounding Image Matching in 3d with Mast3r",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXXII: 71-91",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240868"}

@inproceedings{bb245963,
        AUTHOR = "Unal, O. and Sakaridis, C. and Saha, S. and Van Gool, L.J.",
        TITLE = "Four Ways to Improve Verbo-visual Fusion for Dense 3d Visual Grounding",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXXVI: 196-213",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240869"}

@inproceedings{bb245964,
        AUTHOR = "Wan, D. and Cho, J. and Stengel Eskin, E. and Bansal, M.",
        TITLE = "Contrastive Region Guidance: Improving Grounding in Vision-language
Models Without Training",
        BOOKTITLE = ECCV24,
        YEAR = "2024",
        PAGES = "LXXIX: 198-215",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240870"}

@inproceedings{bb245965,
        AUTHOR = "Khoshsirat, S. and Kambhamettu, C.",
        TITLE = "Embedding Attention Blocks for Answer Grounding",
        BOOKTITLE = ICIP24,
        YEAR = "2024",
        PAGES = "521-527",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240871"}

@inproceedings{bb245966,
        AUTHOR = "Hamilton, M. and Zisserman, A. and Hershey, J.R. and Freeman, W.T.",
        TITLE = "Separating the 'Chirp' from the 'Chat':
Self-supervised Visual Grounding of Sound and Language",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13117-13127",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240872"}

@inproceedings{bb245967,
        AUTHOR = "Shen, Y.H. and Fu, C.Y. and Chen, P.X. and Zhang, M. and Li, K. and Sun, X. and Wu, Y.S. and Lin, S.H. and Ji, R.R.",
        TITLE = "Aligning and Prompting Everything All at Once for Universal Visual
Perception",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13193-13203",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240873"}

@inproceedings{bb245968,
        AUTHOR = "Wu, T.H. and Biamby, G. and Chan, D. and Dunlap, L. and Gupta, R. and Wang, X.D. and Gonzalez, J.E. and Darrell, T.J.",
        TITLE = "See, Say, and Segment: Teaching LMMs to Overcome False Premises",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13459-13469",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240874"}

@inproceedings{bb245969,
        AUTHOR = "Wang, Y. and Li, Y. and Wang, S.J.",
        TITLE = "G3-LQ: Marrying Hyperbolic Alignment with Explicit Semantic-Geometric
Modeling for 3D Visual Grounding",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13917-13926",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240875"}

@inproceedings{bb245970,
        AUTHOR = "Rizve, M.N. and Fei, F. and Unnikrishnan, J. and Tran, S. and Yao, B.Z. and Zeng, B. and Shah, M. and Chilimbi, T.",
        TITLE = "VidLA: Video-Language Alignment at Scale",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "14043-14055",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240876"}

@inproceedings{bb245971,
        AUTHOR = "Shi, X.X. and Wu, Z.H. and Lee, S.",
        TITLE = "Viewpoint-Aware Visual Grounding in 3D Scenes",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "14056-14065",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240877"}

@inproceedings{bb245972,
        AUTHOR = "Feng, C.J. and Zhong, Y.J. and Jie, Z.Q. and Xie, W. and Ma, L.",
        TITLE = "InstaGen: Enhancing Object Detection by Training on Synthetic Dataset",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "14121-14130",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240878"}

@inproceedings{bb245973,
        AUTHOR = "Chang, C.P. and Wang, S.X. and Pagani, A. and Stricker, D.",
        TITLE = "MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual
Grounding",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "14131-14140",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240879"}

@inproceedings{bb245974,
        AUTHOR = "Wang, S. and Lin, Y.T. and Wu, Y.",
        TITLE = "Omni-Q: Omni-Directional Scene Understanding for Unsupervised Visual
Grounding",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "14261-14270",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240880"}

@inproceedings{bb245975,
        AUTHOR = "Shen, Y.H. and Wang, H.Y. and Yang, X.T. and Feiszli, M. and Elhamifar, E. and Torresani, L. and Mavroudi, E.",
        TITLE = "Learning to Segment Referred Objects from Narrated Egocentric Videos",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "14510-14520",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240881"}

@inproceedings{bb245976,
        AUTHOR = "Xu, C. and Han, Y.H. and Xu, R. and Hui, L. and Xie, J. and Yang, J.",
        TITLE = "Multi-Attribute Interactions Matter for 3D Visual Grounding",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "17253-17262",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240882"}

@inproceedings{bb245977,
        AUTHOR = "Tao, M. and Bai, B. and Lin, H.Z. and Wang, H. and Wang, Y. and Luo, L. and Fang, L.",
        TITLE = "When Visual Grounding Meets Gigapixel-Level Large-Scale Scenes:
Benchmark and Approach",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "22119-22128",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240883"}

@inproceedings{bb245978,
        AUTHOR = "Rasheed, H. and Maaz, M. and Shaji, S. and Shaker, A. and Khan, S. and Cholakkal, H. and Anwer, R.M. and Xing, E. and Yang, M.H. and Khan, F.S.",
        TITLE = "GLaMM: Pixel Grounding Large Multimodal Model",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13009-13018",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240884"}

@inproceedings{bb245979,
        AUTHOR = "Zhang, Y.Q. and Luo, H. and Lei, Y.J.",
        TITLE = "Towards CLIP-Driven Language-Free 3D Visual Grounding via 2D-3D
Relational Enhancement and Consistency",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "13063-13072",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240885"}

@inproceedings{bb245980,
        AUTHOR = "Xiao, B. and Wu, H.P. and Xu, W.J. and Dai, X.Y. and Hu, H.D. and Lu, Y. and Zeng, M. and Liu, C. and Yuan, L.",
        TITLE = "Florence-2: Advancing a Unified Representation for a Variety of
Vision Tasks",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "4818-4829",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240886"}

@inproceedings{bb245981,
        AUTHOR = "Qian, S.Y. and Chen, W.F. and Bai, M. and Zhou, X. and Tu, Z.W. and Li, L.E.",
        TITLE = "AffordanceLLM: Grounding Affordance from Vision Language Models",
        BOOKTITLE = OpenSUN3D24,
        YEAR = "2024",
        PAGES = "7587-7597",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240887"}

@inproceedings{bb245982,
        AUTHOR = "Miyanishi, T. and Azuma, D. and Kurita, S. and Kawanabe, M.",
        TITLE = "Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans",
        BOOKTITLE = "3DV24",
        YEAR = "2024",
        PAGES = "717-727",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240888"}

@inproceedings{bb245983,
        AUTHOR = "Gong, R. and Huang, J.Y. and Zhao, Y.Z. and Geng, H.R. and Gao, X.F. and Wu, Q.Y. and Ai, W. and Zhou, Z.H. and Terzopoulos, D. and Zhu, S.C. and Jia, B.X. and Huang, S.Y.",
        TITLE = "ARNOLD: A Benchmark for Language-Grounded Task Learning With
Continuous States in Realistic 3D Scenes",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "20426-20438",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240889"}

@inproceedings{bb245984,
        AUTHOR = "Wu, Y. and Wei, Y. and Wang, H.Z. and Liu, Y.F. and Yang, S. and He, X.M.",
        TITLE = "Grounded Image Text Matching with Mismatched Relation Reasoning",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2964-2975",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240890"}

@inproceedings{bb245985,
        AUTHOR = "Lee, C. and Kumar, M.G. and Tan, C.",
        TITLE = "DetermiNet: A Large-Scale Diagnostic Dataset for Complex
Visually-Grounded Referencing using Determiners",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "19962-19971",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240891"}

@inproceedings{bb245986,
        AUTHOR = "Lin, K.Q.H. and Zhang, P.C. and Chen, J. and Pramanick, S. and Gao, D.F. and Wang, A.J.P. and Yan, R. and Shou, M.Z.",
        TITLE = "UniVTG: Towards Unified Video-Language Temporal Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2782-2792",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240892"}

@inproceedings{bb245987,
        AUTHOR = "Khoshsirat, S. and Kambhamettu, C.",
        TITLE = "Sentence Attention Blocks for Answer Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "6057-6067",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240893"}

@inproceedings{bb245988,
        AUTHOR = "Zhang, Y.M. and Gong, Z. and Chang, A.X.",
        TITLE = "Multi3DRefer: Grounding Text Description to Multiple 3D Objects",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "15179-15179",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240894"}

@inproceedings{bb245989,
        AUTHOR = "Li, H. and Wei, P. and Ma, Z. and Zheng, N.N.",
        TITLE = "Inverse Compositional Learning for Weakly-supervised Relation
Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "15431-15441",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240895"}

@inproceedings{bb245990,
        AUTHOR = "Chen, D.Z.Y. and Hu, R.H. and Chen, X.L. and Nießner, M. and Chang, A.X.",
        TITLE = "UniT3D: A Unified Transformer for 3D Dense Captioning and Visual
Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "18063-18073",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240896"}

@inproceedings{bb245991,
        AUTHOR = "Wang, Z. and Huang, H.F. and Zhao, Y. and Li, L.J. and Cheng, X.Z. and Zhu, Y.C. and Yin, A. and Zhao, Z.",
        TITLE = "Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly
Supervised 3D Visual Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "2662-2671",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240897"}

@inproceedings{bb245992,
        AUTHOR = "Guo, Z. and Tang, Y.W. and Zhang, R. and Wang, D. and Wang, Z.G. and Zhao, B. and Li, X.L.",
        TITLE = "ViewRefer: Grasp the Multi-view Knowledge for 3D Visual Grounding",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "15326-15337",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240898"}

@inproceedings{bb245993,
        AUTHOR = "Hsu, J. and Mao, J.Y. and Wu, J.J.",
        TITLE = "NS3D: Neuro-Symbolic Grounding of 3D Objects and Relations",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "2614-2623",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240899"}

@inproceedings{bb245994,
        AUTHOR = "Yi, J. and Uzkent, B. and Ignat, O. and Li, Z.L. and Garg, A. and Yu, X. and Liu, L.",
        TITLE = "Augment the Pairs: Semantics-Preserving Image-Caption Pair
Augmentation for Grounding-Based Vision and Language Models",
        BOOKTITLE = WACV24,
        YEAR = "2024",
        PAGES = "5508-5518",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240900"}

@inproceedings{bb245995,
        AUTHOR = "Uzkent, B. and Garg, A. and Zhu, W.T. and Doshi, K. and Yi, J. and Wang, X.L. and Omar, M.",
        TITLE = "Dynamic Inference with Grounding Based Vision and Language Models",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "2624-2633",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240901"}

@inproceedings{bb245996,
        AUTHOR = "Shaharabany, T. and Wolf, L.B.",
        TITLE = "Similarity Maps for Self-Training Weakly-Supervised Phrase Grounding",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "6925-6934",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240902"}

@inproceedings{bb245997,
        AUTHOR = "Su, W. and Miao, P.H. and Dou, H.Z. and Wang, G.A. and Qiao, L. and Li, Z.Y. and Li, X.",
        TITLE = "Language Adaptive Weight Generation for Multi-Task Visual Grounding",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "10857-10866",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240903"}

@inproceedings{bb245998,
        AUTHOR = "Li, G. and Jampani, V. and Sun, D.Q. and Sevilla Lara, L.",
        TITLE = "LOCATE: Localize and Transfer Object Parts for Weakly Supervised
Affordance Grounding",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "10922-10931",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240904"}

@inproceedings{bb245999,
        AUTHOR = "Kim, S. and Oh, J. and Lee, S.J. and Yu, S. and Do, J. and Taghavi, T.",
        TITLE = "Grounding Counterfactual Explanation of Image Classifiers to Textual
Concept Space",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "10942-10950",
        BIBSOURCE = "http://www.visionbib.com/bibliography/applicat803vgr2.html#TT240905"}

Last update:Aug 19, 2026 at 13:26:35