@article{bb386400,
        AUTHOR = "Constantinides, A.G. and Pnevmatikakis, A. and Talantzis, F.",
        TITLE = "Audio-Visual Active Speaker Tracking in Cluttered Indoors Environments",
        JOURNAL = SMC-B,
        VOLUME = "38",
        YEAR = "2008",
        NUMBER = "3",
        MONTH = "June",
        PAGES = "799-807",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380466"}

@article{bb386401,
        AUTHOR = "Lee, J.S. and de Simone, F. and Ebrahimi, T.",
        TITLE = "Efficient video coding based on audio-visual focus of attention",
        JOURNAL = JVCIR,
        VOLUME = "22",
        YEAR = "2011",
        NUMBER = "8",
        MONTH = "November",
        PAGES = "704-711",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380467"}

@article{bb386402,
        AUTHOR = "Blauth, D.A. and Minotto, V.P. and Jung, C.R. and Lee, B. and Kalker, T.",
        TITLE = "Voice activity detection and speaker localization using audiovisual
cues",
        JOURNAL = PRL,
        VOLUME = "33",
        YEAR = "2012",
        NUMBER = "4",
        MONTH = "March",
        PAGES = "373-380",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380468"}

@inproceedings{bb386403,
        AUTHOR = "Montazzolli, S. and Jung, C.R. and Gelb, D.",
        TITLE = "Audiovisual voice activity detection using off-the-shelf cameras",
        BOOKTITLE = ICIP15,
        YEAR = "2015",
        PAGES = "3886-3890",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380469"}

@article{bb386404,
        AUTHOR = "Minotto, V.P. and Jung, C.R. and Lee, B.",
        TITLE = "Simultaneous-Speaker Voice Activity Detection and Localization Using
Mid-Fusion of SVM and HMMs",
        JOURNAL = MultMed,
        VOLUME = "16",
        YEAR = "2014",
        NUMBER = "4",
        MONTH = "June",
        PAGES = "1032-1044",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380470"}

@article{bb386405,
        AUTHOR = "Qian, X. and Brutti, A. and Lanz, O. and Omologo, M. and Cavallaro, A.",
        TITLE = "Multi-Speaker Tracking From an Audio-Visual Sensing Device",
        JOURNAL = MultMed,
        VOLUME = "21",
        YEAR = "2019",
        NUMBER = "10",
        MONTH = "October",
        PAGES = "2576-2588",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380471"}

@article{bb386406,
        AUTHOR = "Pu, J. and Panagakis, Y. and Pantic, M.",
        TITLE = "Active Speaker Detection and Localization in Videos Using Low-Rank
and Kernelized Sparsity",
        JOURNAL = SPLetters,
        VOLUME = "27",
        YEAR = "2020",
        PAGES = "865-869",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380472"}

@article{bb386407,
        AUTHOR = "Qian, X.Y. and Liu, Q. and Wang, J.D. and Li, H.Z.",
        TITLE = "Three-Dimensional Speaker Localization: Audio-Refined Visual Scaling
Factor Estimation",
        JOURNAL = SPLetters,
        VOLUME = "28",
        YEAR = "2021",
        PAGES = "1405-1409",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380473"}

@article{bb386408,
        AUTHOR = "Ban, Y.T. and Alameda Pineda, X. and Girin, L. and Horaud, R.",
        TITLE = "Variational Bayesian Inference for Audio-Visual Tracking of Multiple
Speakers",
        JOURNAL = PAMI,
        VOLUME = "43",
        YEAR = "2021",
        NUMBER = "5",
        MONTH = "May",
        PAGES = "1761-1776",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380474"}

@inproceedings{bb386409,
        AUTHOR = "Ban, Y.T. and Girin, L. and Alameda Pineda, X. and Horaud, R.",
        TITLE = "Exploiting the Complementarity of Audio and Visual Data in
Multi-speaker Tracking",
        BOOKTITLE = CVAVM17,
        YEAR = "2017",
        PAGES = "446-454",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380475"}

@article{bb386410,
        AUTHOR = "Qian, X.Y. and Brutti, A. and Lanz, O. and Omologo, M. and Cavallaro, A.",
        TITLE = "Audio-Visual Tracking of Concurrent Speakers",
        JOURNAL = MultMed,
        VOLUME = "24",
        YEAR = "2022",
        PAGES = "942-954",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380476"}

@article{bb386411,
        AUTHOR = "Hu, D. and Wei, Y. and Qian, R. and Lin, W.Y. and Song, R.H. and Wen, J.R.",
        TITLE = "Class-Aware Sounding Objects Localization via Audiovisual
Correspondence",
        JOURNAL = PAMI,
        VOLUME = "44",
        YEAR = "2022",
        NUMBER = "12",
        MONTH = "December",
        PAGES = "9844-9859",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380477"}

@article{bb386412,
        AUTHOR = "Zheng, A. and Hu, M. and Jiang, B. and Huang, Y. and Yan, Y. and Luo, B.",
        TITLE = "Adversarial-Metric Learning for Audio-Visual Cross-Modal Matching",
        JOURNAL = MultMed,
        VOLUME = "24",
        YEAR = "2022",
        PAGES = "338-351",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380478"}

@article{bb386413,
        AUTHOR = "Wang, H. and Zha, Z.J. and Li, L. and Chen, X.J. and Luo, J.B.",
        TITLE = "Semantic and Relation Modulation for Audio-Visual Event Localization",
        JOURNAL = PAMI,
        VOLUME = "45",
        YEAR = "2023",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "7711-7725",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380479"}

@article{bb386414,
        AUTHOR = "Garg, R. and Gao, R.H. and Grauman, K.",
        TITLE = "Visually-Guided Audio Spatialization in Video with Geometry-Aware
Multi-task Learning",
        JOURNAL = IJCV,
        VOLUME = "131",
        YEAR = "2023",
        NUMBER = "10",
        MONTH = "October",
        PAGES = "2723-2737",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380480"}

@article{bb386415,
        AUTHOR = "Wang, J.X. and Li, C.L. and Zheng, A. and Tang, J. and Luo, B.",
        TITLE = "Looking and Hearing Into Details:
Dual-Enhanced Siamese Adversarial Network for Audio-Visual Matching",
        JOURNAL = MultMed,
        VOLUME = "25",
        YEAR = "2023",
        PAGES = "7505-7516",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380481"}

@article{bb386416,
        AUTHOR = "Traa, J. and Smaragdis, P.",
        TITLE = "A Wrapped Kalman Filter for Azimuthal Speaker Tracking",
        JOURNAL = SPLetters,
        VOLUME = "20",
        YEAR = "2013",
        NUMBER = "12",
        PAGES = "1257-1260",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380482"}

@article{bb386417,
        AUTHOR = "Qian, X.Y. and Zhang, Q. and Guan, G.H. and Xue, W.",
        TITLE = "Deep Audio-Visual Beamforming for Speaker Localization",
        JOURNAL = SPLetters,
        VOLUME = "29",
        YEAR = "2022",
        PAGES = "1132-1136",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380483"}

@article{bb386418,
        AUTHOR = "Xuan, H.Y. and Wu, Z.L. and Yang, J. and Jiang, B. and Luo, L. and Alameda Pineda, X. and Yan, Y.",
        TITLE = "Robust Audio-Visual Contrastive Learning for Proposal-Based
Self-Supervised Sound Source Localization in Videos",
        JOURNAL = PAMI,
        VOLUME = "46",
        YEAR = "2024",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "4896-4907",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380484"}

@inproceedings{bb386419,
        AUTHOR = "Xuan, H.Y. and Wu, Z.L. and Yang, J. and Yan, Y. and Alameda Pineda, X.",
        TITLE = "A Proposal-based Paradigm for Self-supervised Sound Source
Localization in Videos",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "1019-1028",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380485"}

@article{bb386420,
        AUTHOR = "Li, Y. and Liu, H. and Yang, B.",
        TITLE = "STNet: Deep Audio-Visual Fusion Network for Robust Speaker Tracking",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "1835-1847",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380486"}

@article{bb386421,
        AUTHOR = "Li, Y. and Li, Y.H. and Xu, Z. and Wan, W.W. and Liu, H.",
        TITLE = "Global-local distillation network-based audio-visual speaker tracking
with incomplete modalities",
        JOURNAL = PR,
        VOLUME = "179",
        YEAR = "2026",
        PAGES = "113916",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380487"}

@article{bb386422,
        AUTHOR = "Senocak, A. and Ryu, H. and Kim, J. and Oh, T.H. and Pfister, H. and Chung, J.S.",
        TITLE = "Toward Interactive Sound Source Localization:
Better Align Sight and Sound!",
        JOURNAL = PAMI,
        VOLUME = "47",
        YEAR = "2025",
        NUMBER = "9",
        MONTH = "September",
        PAGES = "7643-7659",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380488"}

@article{bb386423,
        AUTHOR = "Liao, J.H. and Duan, H.H. and Feng, K.H. and Zhao, W.B. and Yang, Y.B. and Chen, L.Y. and Chen, Y.R.",
        TITLE = "LR-ASD: Lightweight and Robust Network for Active Speaker Detection",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "4749-4769",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380489"}

@article{bb386424,
        AUTHOR = "Jiang, Z.Y. and Chen, X. and Wang, S. and Qian, X.Y. and Li, H.Z.",
        TITLE = "TPEech: Target Speaker Extraction and Noise Suppression With
Historical Dialogue Text Cues",
        JOURNAL = SPLetters,
        VOLUME = "33",
        YEAR = "2026",
        PAGES = "351-355",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380490"}

@article{bb386425,
        AUTHOR = "Yang, W.H. and Wei, J.G. and Lu, W.H. and Song, X.Y. and Yue, X.",
        TITLE = "Listening for 'You': Enhancing Speech Image Retrieval via Target
Speaker Extraction",
        JOURNAL = SPLetters,
        VOLUME = "33",
        YEAR = "2026",
        PAGES = "201-205",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380491"}

@article{bb386426,
        AUTHOR = "Li, Z.J. and Li, J.B. and Huang, D. and Jiao, J.B. and Li, J.Z. and Zhao, B.",
        TITLE = "Audio denoising and audio-visual localization for unmanned aerial
vehicles",
        JOURNAL = PR,
        VOLUME = "179",
        YEAR = "2026",
        PAGES = "113931",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380492"}

@article{bb386427,
        AUTHOR = "He, Y.Z. and Liu, Y. and Zhang, C. and Zhu, D.C. and Wang, L.",
        TITLE = "Learning to chase: Adaptive audio-visual navigation for moving sounds
in complex environments",
        JOURNAL = PRL,
        VOLUME = "206",
        YEAR = "2026",
        PAGES = "69-74",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380493"}

@inproceedings{bb386428,
        AUTHOR = "Zeng, Z. and Peng, C. and Celiktutan, O.",
        TITLE = "Multimodal Voice Activity Projection for Multi-Party Conversations",
        BOOKTITLE = FG26,
        YEAR = "2026",
        PAGES = "1-5",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380494"}

@inproceedings{bb386429,
        AUTHOR = "Wang, Y. and Ha, J. and Ramirez, F.M. and Wang, Y.C. and Crandall, D.J.",
        TITLE = "GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker
Detection",
        BOOKTITLE = WACV26,
        YEAR = "2026",
        PAGES = "1074-1083",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380495"}

@inproceedings{bb386430,
        AUTHOR = "Um, S.J. and Kim, D.J. and Lee, S. and Kim, J.U.",
        TITLE = "Object-aware Sound Source Localization via Audio-Visual Scene
Understanding",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "8342-8351",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380496"}

@inproceedings{bb386431,
        AUTHOR = "Kim, I.H. and Song, Y. and Park, J. and Kim, W.H. and Kwak, S.",
        TITLE = "Improving Sound Source Localization with Joint Slot Attention on
Image and Audio",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "3121-3130",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380497"}

@inproceedings{bb386432,
        AUTHOR = "Ryu, H. and Kim, S. and Chung, J.S. and Senocak, A.",
        TITLE = "Seeing Speech and Sound: Distinguishing and Locating Audio Sources in
Visual Scenes",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "13540-13549",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380498"}

@inproceedings{bb386433,
        AUTHOR = "Ye, Y.X. and Yang, W.M. and Tian, Y.P.",
        TITLE = "LAVSS: Location-Guided Audio-Visual Spatial Audio Separation",
        BOOKTITLE = WACV24,
        YEAR = "2024",
        PAGES = "5496-5507",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380499"}

@inproceedings{bb386434,
        AUTHOR = "Wang, X.Z. and Cheng, F. and Bertasius, G.",
        TITLE = "LoCoNet: Long-Short Context Network for Active Speaker Detection",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "18462-18472",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380500"}

@inproceedings{bb386435,
        AUTHOR = "Chen, J.B. and Zhang, R.R. and Lian, D.Z. and Yang, J.Q. and Zeng, Z.Y. and Shi, J.B.",
        TITLE = "iQuery: Instruments as Queries for Audio-Visual Sound Separation",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "14675-14686",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380501"}

@inproceedings{bb386436,
        AUTHOR = "Tan, R. and Ray, A. and Burns, A. and Plummer, B.A. and Salamon, J. and Nieto, O. and Russell, B. and Saenko, K.",
        TITLE = "Language-Guided Audio-Visual Source Separation via Trimodal
Consistency",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "10575-10584",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380502"}

@inproceedings{bb386437,
        AUTHOR = "Sun, W.X. and Zhang, J.Y. and Wang, J.Y. and Liu, Z.Y. and Zhong, Y.R. and Feng, T.P. and Guo, Y.D. and Zhang, Y.H. and Barnes, N.M.",
        TITLE = "Learning Audio-Visual Source Localization via False Negative Aware
Contrastive Learning",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "6420-6429",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380503"}

@inproceedings{bb386438,
        AUTHOR = "Huang, C. and Tian, Y.P. and Kumar, A. and Xu, C.L.",
        TITLE = "Egocentric Audio-Visual Object Localization",
        BOOKTITLE = CVPR23,
        YEAR = "2023",
        PAGES = "22910-22921",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380504"}

@inproceedings{bb386439,
        AUTHOR = "Nugroho, M.A. and Woo, S. and Lee, S. and Kim, C.",
        TITLE = "Audio-Visual Glance Network for Efficient Video Recognition",
        BOOKTITLE = ICCV23,
        YEAR = "2023",
        PAGES = "10116-10125",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380505"}

@inproceedings{bb386440,
        AUTHOR = "Liu, Y. and Tan, Y. and Lan, H.Y.",
        TITLE = "Self-Supervised Contrastive Learning for Audio-Visual Action
Recognition",
        BOOKTITLE = ICIP23,
        YEAR = "2023",
        PAGES = "1000-1004",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380506"}

@inproceedings{bb386441,
        AUTHOR = "Alcazar, J.L. and Cordes, M. and Zhao, C. and Ghanem, B.",
        TITLE = "End-to-End Active Speaker Detection",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXVII:126-143",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380507"}

@inproceedings{bb386442,
        AUTHOR = "Mo, S.T. and Morgado, P.",
        TITLE = "Localizing Visual Sounds the Easy Way",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXVII:218-234",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380508"}

@inproceedings{bb386443,
        AUTHOR = "Xia, Y. and Zhao, Z.",
        TITLE = "Cross-modal Background Suppression for Audio-Visual Event
Localization",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "19957-19966",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380509"}

@inproceedings{bb386444,
        AUTHOR = "Wang, H. and Gao, L.L. and Tan, Q.C. and Ji, L.P.",
        TITLE = "Visual Sound Source Separation with Partial Supervision Learning",
        BOOKTITLE = ICIP22,
        YEAR = "2022",
        PAGES = "2127-2131",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380510"}

@inproceedings{bb386445,
        AUTHOR = "Jiang, H. and Murdock, C. and Ithapu, V.K.",
        TITLE = "Egocentric Deep Multi-Channel Audio-Visual Active Speaker
Localization",
        BOOKTITLE = CVPR22,
        YEAR = "2022",
        PAGES = "10534-10542",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380511"}

@inproceedings{bb386446,
        AUTHOR = "Min, K. and Roy, S. and Tripathi, S. and Guha, T. and Majumdar, S.",
        TITLE = "Learning Long-Term Spatial-Temporal Graphs for Active Speaker Detection",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXV:371-387",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380512"}

@inproceedings{bb386447,
        AUTHOR = "Duan, B. and Tang, H. and Wang, W. and Zong, Z.L. and Yang, G.W. and Yan, Y.",
        TITLE = "Audio-Visual Event Localization via Recursive Fusion by Joint
Co-Attention",
        BOOKTITLE = WACV21,
        YEAR = "2021",
        PAGES = "4012-4021",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380513"}

@inproceedings{bb386448,
        AUTHOR = "Nguyen, Q. and Richter, J. and Lauri, M. and Gerkmann, T. and Frintrop, S.",
        TITLE = "Improving mix-and-separate training in audio-visual sound source
separation with an object prior",
        BOOKTITLE = ICPR21,
        YEAR = "2021",
        PAGES = "5844-5851",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380514"}

@inproceedings{bb386449,
        AUTHOR = "Wu, Y. and Zhu, L.C. and Yan, Y. and Yang, Y.",
        TITLE = "Dual Attention Matching for Audio-Visual Event Localization",
        BOOKTITLE = ICCV19,
        YEAR = "2019",
        PAGES = "6291-6299",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380515"}

@inproceedings{bb386450,
        AUTHOR = "Majumder, S. and Grauman, K.",
        TITLE = "Active Audio-Visual Separation of Dynamic Sound Sources",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXIX:551-569",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380516"}

@inproceedings{bb386451,
        AUTHOR = "Majumder, S. and Al Halah, Z. and Grauman, K.",
        TITLE = "Move2Hear: Active Audio-Visual Source Separation",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "275-285",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380517"}

@inproceedings{bb386452,
        AUTHOR = "Alcazar, J.L. and Heilbron, F.C. and Thabet, A.K. and Ghanem, B.",
        TITLE = "MAAS: Multi-modal Assignation for Active Speaker Detection",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "265-274",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380518"}

@inproceedings{bb386453,
        AUTHOR = "Kopuklu, O. and Taseska, M. and Rigoll, G.",
        TITLE = "How to Design a Three-Stage Architecture for Audio-Visual Active
Speaker Detection in the Wild",
        BOOKTITLE = ICCV21,
        YEAR = "2021",
        PAGES = "1173-1183",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380519"}

@inproceedings{bb386454,
        AUTHOR = "Wu, Y. and Yang, Y.",
        TITLE = "Exploring Heterogeneous Clues for Weakly-Supervised Audio-Visual
Video Parsing",
        BOOKTITLE = CVPR21,
        YEAR = "2021",
        PAGES = "1326-1335",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380520"}

@inproceedings{bb386455,
        AUTHOR = "Liu, H. and Sun, Y.H. and Li, Y.D. and Yang, B.",
        TITLE = "3D Audio-Visual Speaker Tracking with A Novel Particle Filter",
        BOOKTITLE = ICPR21,
        YEAR = "2021",
        PAGES = "7343-7348",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380521"}

@inproceedings{bb386456,
        AUTHOR = "Liu, H. and Li, Y.D. and Yang, B.",
        TITLE = "3D Audio-Visual Speaker Tracking with A Two-Layer Particle Filter",
        BOOKTITLE = ICIP19,
        YEAR = "2019",
        PAGES = "1955-1959",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380522"}

@inproceedings{bb386457,
        AUTHOR = "He, G. and Liu, X. and Fan, F. and You, J.",
        TITLE = "Image2Audio: Facilitating Semi-supervised Audio Emotion Recognition
with Facial Expression Image",
        BOOKTITLE = VL3W20,
        YEAR = "2020",
        PAGES = "3978-3983",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380523"}

@inproceedings{bb386458,
        AUTHOR = "Le, N. and Heili, A. and Wu, D. and Odobez, J.M.",
        TITLE = "Temporally subsampled detection for accurate and efficient face
tracking and diarization",
        BOOKTITLE = ICPR16,
        YEAR = "2016",
        PAGES = "1792-1797",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380524"}

@inproceedings{bb386459,
        AUTHOR = "Saeed, A. and Al Hamadi, A. and Heuer, M.",
        TITLE = "Speaker Tracking Using Multi-modal Fusion Framework",
        BOOKTITLE = ICISP12,
        YEAR = "2012",
        PAGES = "539-546",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380525"}

@inproceedings{bb386460,
        AUTHOR = "Kelly, D. and Pitie, F. and Kokaram, A. and Boland, F.",
        TITLE = "A Comparative Error Analysis of Audio-Visual Source Localization",
        BOOKTITLE = M2SFA208,
        YEAR = "2008",
        PAGES = "xx-yy",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380526"}

@inproceedings{bb386461,
        AUTHOR = "Katsarakis, N. and Talantzis, F. and Pnevmatikakis, A. and Polymenakos, L.",
        TITLE = "The AIT 3D Audio / Visual Person Tracker for CLEAR 2007",
        BOOKTITLE = MTPH07,
        YEAR = "2007",
        PAGES = "xx-yy",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380527"}

@inproceedings{bb386462,
        AUTHOR = "Kushal, A. and Rahurkar, M. and Fei Fei, L. and Ponce, J. and Huang, T.",
        TITLE = "Audio-Visual Speaker Localization Using Graphical Models",
        BOOKTITLE = ICPR06,
        YEAR = "2006",
        PAGES = "I: 291-294",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380528"}

@inproceedings{bb386463,
        AUTHOR = "Tsuji, T. and Yamamoto, K. and Ishii, I.",
        TITLE = "Real-time Sound Source Localization Based on Audiovisual Frequency
Integration",
        BOOKTITLE = ICPR06,
        YEAR = "2006",
        PAGES = "IV: 322-325",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380529"}

@inproceedings{bb386464,
        AUTHOR = "Megherbi, N. and Ambellouis, S. and Colot, O. and Cabestaing, F.",
        TITLE = "Data Association in Multi-Target Tracking Using Belief Theory:
Handling Target Emergence and Disappearance Issue",
        BOOKTITLE = AVSBS05,
        YEAR = "2005",
        PAGES = "517-521",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380530"}

@inproceedings{bb386465,
        AUTHOR = "Megherbi, N. and Ambellouis, S. and Colot, O. and Cabestaing, F.",
        TITLE = "Joint audio-video people tracking using belief theory",
        BOOKTITLE = AVSBS05,
        YEAR = "2005",
        PAGES = "135-140",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380531"}

@inproceedings{bb386466,
        AUTHOR = "Li, X. and Sun, L. and Tao, L.M. and Xu, G.Y. and Jia, Y.",
        TITLE = "A Speaker Tracking Algorithm Based on Audio and Visual Information
Fusion Using Particle Filter",
        BOOKTITLE = ICIAR04,
        YEAR = "2004",
        PAGES = "II: 572-580",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380532"}

@inproceedings{bb386467,
        AUTHOR = "Lange, C. and Hermann, T. and Ritter, H.",
        TITLE = "Holistic Body Tracking for Gestural Interfaces",
        BOOKTITLE = GW03,
        YEAR = "2003",
        PAGES = "132-139",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380533"}

@inproceedings{bb386468,
        AUTHOR = "Blake, A. and Gangnet, M. and Perez, P. and Vermaak, J.",
        TITLE = "Integrated tracking with vision and sound",
        BOOKTITLE = CIAP01,
        YEAR = "2001",
        PAGES = "354-357",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avt1.html#TT380534"}

@article{bb386469,
        AUTHOR = "Liu, C. and Li, P. and Zhang, H. and Li, L.C. and Huang, Z. and Wang, D.D. and Yu, X.",
        TITLE = "BAVS: Bootstrapping Audio-Visual Segmentation by Integrating
Foundation Knowledge",
        JOURNAL = MultMed,
        VOLUME = "26",
        YEAR = "2024",
        PAGES = "10015-10028",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380535"}

@inproceedings{bb386470,
        AUTHOR = "Liu, C. and Yang, L.Y. and Li, P. and Wang, D.D. and Li, L.C. and Yu, X.",
        TITLE = "Dynamic Derivation and Elimination: Audio Visual Segmentation with
Enhanced Audio Semantics",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "3131-3141",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380536"}

@inproceedings{bb386471,
        AUTHOR = "Liu, C. and Li, P. and Yang, L.Y. and Wang, D.D. and Li, L.C. and Yu, X.",
        TITLE = "Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent
Alignment",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "28922-28931",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380537"}

@inproceedings{bb386472,
        AUTHOR = "Liu, C. and Li, P.P. and Yu, Q.T. and Sheng, H.W. and Wang, D.D. and Li, L.C. and Yu, X.",
        TITLE = "Benchmarking Audio Visual Segmentation for Long-Untrimmed Videos",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "22712-22722",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380538"}

@article{bb386473,
        AUTHOR = "Shi, Z.F. and Wu, Q.B. and Meng, F.M. and Xu, L.F. and Li, H.L.",
        TITLE = "Cross-Modal Cognitive Consensus Guided Audio-Visual Segmentation",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "209-223",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380539"}

@article{bb386474,
        AUTHOR = "Zhou, J.X. and Shen, X.Y. and Wang, J.Y. and Zhang, J.Y. and Sun, W.X. and Zhang, J. and Birchfield, S. and Guo, D. and Kong, L.P. and Wang, M. and Zhong, Y.R.",
        TITLE = "Audio-Visual Segmentation with Semantics",
        JOURNAL = IJCV,
        VOLUME = "133",
        YEAR = "2025",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "1644-1664",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380540"}

@article{bb386475,
        AUTHOR = "Lv, Y. and Liu, Z. and Chang, X.J.",
        TITLE = "Consistency-Queried Transformer for Audio-Visual Segmentation",
        JOURNAL = IP,
        VOLUME = "34",
        YEAR = "2025",
        PAGES = "2616-2627",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380541"}

@article{bb386476,
        AUTHOR = "Zhu, Y. and Li, K. and Yang, Z.X.",
        TITLE = "Exploiting EfficientSAM and Temporal Coherence for Audio-Visual
Segmentation",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "2999-3008",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380542"}

@article{bb386477,
        AUTHOR = "Mao, Y.X. and Zhang, J. and Xiang, M. and Lv, Y.Q. and Li, D. and Zhong, Y.R. and Dai, Y.C.",
        TITLE = "Contrastive Conditional Latent Diffusion for Audio-Visual
Segmentation",
        JOURNAL = IP,
        VOLUME = "34",
        YEAR = "2025",
        PAGES = "4108-4119",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380543"}

@article{bb386478,
        AUTHOR = "Xuan, H.Y. and Liu, T.X. and Dong, W.X. and Li, Z.H. and Chen, S.",
        TITLE = "X-STA: Cross-Modal Spatial-Temporal Alignment Network for Unified
Audio-Visual Segmentation",
        JOURNAL = SPLetters,
        VOLUME = "32",
        YEAR = "2025",
        PAGES = "2883-2887",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380544"}

@article{bb386479,
        AUTHOR = "Gong, S. and Zhuge, Y.Z. and Zhang, L. and Wang, Y.F. and Zhang, P.P. and Wang, L.J. and Lu, H.C.",
        TITLE = "AVS-Mamba: Exploring Temporal and Multi-Modal Mamba for Audio-Visual
Segmentation",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "5413-5425",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380545"}

@article{bb386480,
        AUTHOR = "Gong, S. and Zhuge, Y.Z. and Zhang, L. and Zhang, P.P. and Lu, H.C.",
        TITLE = "Complementary and Contrastive Learning for Audio-Visual Segmentation",
        JOURNAL = MultMed,
        VOLUME = "27",
        YEAR = "2025",
        PAGES = "7407-7418",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380546"}

@article{bb386481,
        AUTHOR = "Nguyen, K.B. and Park, C.J.",
        TITLE = "SAVE: Segment Audio-Visual Easy way using the Segment Anything Model",
        JOURNAL = CVIU,
        VOLUME = "260",
        YEAR = "2025",
        PAGES = "104460",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380547"}

@article{bb386482,
        AUTHOR = "Wang, Y. and Qian, X.H. and Zhou, W.",
        TITLE = "Transformer-Prompted Network: Efficient Audio-Visual Segmentation via
Transformer and Prompt Learning",
        JOURNAL = SPLetters,
        VOLUME = "32",
        YEAR = "2025",
        PAGES = "516-520",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380548"}

@article{bb386483,
        AUTHOR = "Zhou, J.X. and Li, Z.H. and Yu, Y.Q. and Zhou, Y.H. and Guo, R. and Li, G.Y. and Mao, Y.X. and Han, M.F. and Chang, X.J. and Wang, M.",
        TITLE = "Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation",
        JOURNAL = PAMI,
        VOLUME = "48",
        YEAR = "2026",
        NUMBER = "4",
        MONTH = "April",
        PAGES = "4222-4238",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380549"}

@article{bb386484,
        AUTHOR = "Shen, L. and Wang, Y.Z. and Fan, X. and Wei, Y.N. and Qiu, H.X.",
        TITLE = "AV2TS: A Multivariate Time Series Modeling Framework for Audio-Visual
Segmentation",
        JOURNAL = MultMed,
        VOLUME = "28",
        YEAR = "2026",
        PAGES = "4056-4068",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380550"}

@article{bb386485,
        AUTHOR = "Wang, J.X. and Zheng, A. and Li, D. and Li, C.L. and Cheng, W.J. and He, R.",
        TITLE = "Bidirectional intervention attention network for audio-visual
matching",
        JOURNAL = PR,
        VOLUME = "179",
        YEAR = "2026",
        PAGES = "113840",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380551"}

@article{bb386486,
        AUTHOR = "Asaf, T. and Walgama, R.",
        TITLE = "Deep Learning for Audio-Visual Segmentation:
A review of models, datasets, and challenges",
        JOURNAL = IVC,
        VOLUME = "174",
        YEAR = "2026",
        PAGES = "106144",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380552"}

@article{bb386487,
        AUTHOR = "Zhuge, Y.Z. and Zhu, M.Y. and Peng, Y.Z. and Zhang, L. and Zhan, J. and Zhang, P.P. and Lu, H.C.",
        TITLE = "Bridging CLIP and CLAP for open-vocabulary audio-visual segmentation
with semantic coherence",
        JOURNAL = PR,
        VOLUME = "180",
        YEAR = "2026",
        PAGES = "114586",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380553"}

@inproceedings{bb386488,
        AUTHOR = "Huang, S.F. and Ling, R. and Hui, T.R. and Li, H.Y. and Zhou, X. and Zhang, S.F. and Liu, S. and Hong, R.C. and Wang, M.",
        TITLE = "Revisiting Audio-Visual Segmentation with Vision-Centric Transformer",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "8352-8361",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380554"}

@inproceedings{bb386489,
        AUTHOR = "Radman, A. and Laaksonen, J.",
        TITLE = "TSAM: Temporal SAM Augmented with Multimodal Prompts for Referring
Audio-Visual Segmentation",
        BOOKTITLE = CVPR25,
        YEAR = "2025",
        PAGES = "23947-23956",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380555"}

@inproceedings{bb386490,
        AUTHOR = "Seon, J. and Im, W.B. and Lee, S. and Lee, J. and Yoon, S.E.",
        TITLE = "Extending Segment Anything Model into Auditory and Temporal
Dimensions for Audio-Visual Segmentation",
        BOOKTITLE = ICIP24,
        YEAR = "2024",
        PAGES = "2480-2486",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380556"}

@inproceedings{bb386491,
        AUTHOR = "Yang, Q. and Nie, X. and Li, T. and Gao, P.F. and Guo, Y. and Zhen, C. and Yan, P.F. and Xiang, S.M.",
        TITLE = "Cooperation Does Matter: Exploring Multi-Order Bilateral Relations
for Audio-Visual Segmentation",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "27124-27133",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380557"}

@inproceedings{bb386492,
        AUTHOR = "Liu, J.X. and Liu, Y.K. and Zhang, F. and Ju, C. and Zhang, Y. and Wang, Y.F.",
        TITLE = "Audio-Visual Segmentation via Unlabeled Frame Exploitation",
        BOOKTITLE = CVPR24,
        YEAR = "2024",
        PAGES = "26318-26329",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380558"}

@inproceedings{bb386493,
        AUTHOR = "Liu, J.X. and Wang, Y. and Ju, C. and Ma, C.F. and Zhang, Y. and Xie, W.",
        TITLE = "Annotation-free Audio-Visual Segmentation",
        BOOKTITLE = WACV24,
        YEAR = "2024",
        PAGES = "5592-5602",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380559"}

@inproceedings{bb386494,
        AUTHOR = "Zhou, J.X. and Wang, J.Y. and Zhang, J.Y. and Sun, W.X. and Zhang, J. and Birchfield, S. and Guo, D. and Kong, L.P. and Wang, M. and Zhong, Y.R.",
        TITLE = "Audio-Visual Segmentation",
        BOOKTITLE = ECCV22,
        YEAR = "2022",
        PAGES = "XXXVII:386-403",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020avseg3.html#TT380560"}

@article{bb386495,
        AUTHOR = "Arias de Reyna, E. and Murillo Fuentes, J.J. and Boloix Tortosa, R.",
        TITLE = "Blind Low Complexity Time-Of-Arrival Estimation Algorithm for UWB
Signals",
        JOURNAL = SPLetters,
        VOLUME = "22",
        YEAR = "2015",
        NUMBER = "11",
        MONTH = "November",
        PAGES = "2019-2023",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020toa2.html#TT380561"}

@article{bb386496,
        AUTHOR = "Driusso, M. and Comisso, M. and Babich, F. and Marshall, C.",
        TITLE = "Performance Analysis of Time of Arrival Estimation on OFDM Signals",
        JOURNAL = SPLetters,
        VOLUME = "22",
        YEAR = "2015",
        NUMBER = "7",
        MONTH = "July",
        PAGES = "983-987",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020toa2.html#TT380562"}

@article{bb386497,
        AUTHOR = "Shi, X. and Anderson, B.D.O. and Mao, G. and Yang, Z. and Chen, J. and Lin, Z.",
        TITLE = "Robust Localization Using Time Difference of Arrivals",
        JOURNAL = SPLetters,
        VOLUME = "23",
        YEAR = "2016",
        NUMBER = "10",
        MONTH = "October",
        PAGES = "1320-1324",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020toa2.html#TT380563"}

@article{bb386498,
        AUTHOR = "Chen, M. and Mao, X. and Long, X. and Xin, L.",
        TITLE = "Underdetermined Direct Localization of Emitters Based on
Spatio-Temporal Processing",
        JOURNAL = SPLetters,
        VOLUME = "25",
        YEAR = "2018",
        NUMBER = "3",
        MONTH = "March",
        PAGES = "452-456",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020toa2.html#TT380564"}

@article{bb386499,
        AUTHOR = "Daniel, O. and Wymeersch, H. and Nurmi, J.",
        TITLE = "Delay-Accuracy Tradeoff in Opportunistic Time-of-Arrival Localization",
        JOURNAL = SPLetters,
        VOLUME = "25",
        YEAR = "2018",
        NUMBER = "6",
        MONTH = "June",
        PAGES = "763-767",
        BIBSOURCE = "http://www.visionbib.com/bibliography/other1020toa2.html#TT380565"}

Last update:Sep 30, 2026 at 11:45:00