Selected Publications
*denotes the Co-First Authorship, #denotes the Corresponding Author
2026
- Flexible Targeted Adversarial Alignment with Frequency-based Visual Focus for Attacking Large Vision-Language Models.
Daizong Liu, Tianyao Luo, Junhao Dong, Xiaowen Cai, Hao He, Weidong Wang, Runwei Guan, Jianfeng Dong, Pan Zhou, Bo Du, Hui Xiong.
IEEE Transactions on Pattern Analysis and Machine Intelligence, [TPAMI] - Cross-Model Transfer Attacks against Large Vision-Language Models via Model Diversity Enrichment and Stochastic Parameter Sampling.
Zhenze Yang, Xiaowen Cai, Junhao Dong, Guangke Chen, Guiyao Tie, Daizong Liu#, Hongyang He, Zhiyuan Ma, Xiang Fang, Dengpan Ye, Jing Zhang.
The Fortieth Annual Conference on Neural Information Processing Systems, [NeurIPS2026] - Object Hallucination Mitigation in Large Vision-Language Models via Self-Vision Dual Masking and Uncertainty-Triggered Assembly.
Ziji Sheng, Guiyao Tie, Weidong Wang, Jiawen Shi, Junhao Dong, Xiaoye Qu, Shanshan Ye, Daizong Liu#, Dengpan Ye, Pan Zhou, Jing Zhang.
The Fortieth Annual Conference on Neural Information Processing Systems, [NeurIPS2026] - A Survey on AI Agent Security: Reasoning, Acting, and Self-Evolving.
Daizong Liu, Tianyao Luo, Shuwei Huang, Junyi Yang, Siyuan Liang, Xiaojun Jia, Chun Pong Lau, Jianfeng Dong, Yan Liu, Yang Bai, Xun Chen, Shiji Zhou, Ognjen Arandelović, Stefanos Koffas, Zhongliang Guo, Runwei Guan, Pan Zhou, Zhibo Wang, Zhan Qin, Bo Du, Hui Xiong, Pin-Yu Chen, Josep Domingo-Ferrer, and Yiming Li.
The Innovation AI Plus, [AI Plus] - An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs.
Zhi Luo, Zenghui Yuan, Daizong Liu#, Wenqi Wei, Pan Zhou.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2026] - Rethinking 3D Point Cloud Adversarial Attacks from Models’ Inherent Focus.
Li Yang, Xiaowen Cai, Shuqin Chen, Junhao Dong, Keke Tang, Zhongliang Guo, Daizong Liu#.
Expert Systems With Applications, [ESWA] - Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain.
Daizong Liu, Junhao Dong, Zhiyuan Ma, Xiaoye Qu, Xiang Fang, Runwei Guan, Keke Tang, Jianfeng Dong, and Yew-Soon Ong.
IEEE Transactions on Multimedia, [TMM] - Geometric Regularization for Long-Tailed Semi-Supervised Learning via Gaussian Feature Bridges.
Hongyang He, Xinyuan Song, Yan Zhong, Daizong Liu#, Yanbin Li, Yangfan He, Wenqiao Zhang.
European Conference on Computer Vision, [ECCV2026] - Attacking Hard-Label Large Vision-Language Models with Model-Sensitive Adversarial Patch Designs.
Nian Ai, Guangke Chen, Xiaowen Cai, Zhongliang Guo, Daizong Liu#, Pan Zhou, Ognjen Arandjelović.
Pattern Recognition, [PR] - Hard-Label Black-Box Attacks on 3D Point Clouds.
Daizong Liu, Yunbo Tao, Junhao Dong, Keke Tang, Pan Zhou, Wei Hu, Yew-Soon Ong.
IEEE Transactions on Dependable and Secure Computing, [TDSC] - Newton-coupled Dual-Teacher Semi-supervised Learning Framework.
Hongyang He, Yan Zhong, Xinyuan Song, Daizong Liu#, Xuanyu Liu, Victor Sanchez.
The Forty-Third International Conference on Machine Learning, [ICML2026] - Attacking Gray-Box Large Vision-Language Models with Adaptive SVD-Structured Adversarial Alignment.
Daizong Liu, Xiaowen Cai, Junhao Dong, Zhongliang Guo, Xiaoye Qu, Runwei Guan, Xiang Fang, Dengpan Ye.
The Forty-Third International Conference on Machine Learning, [ICML2026] - Understanding and Exploiting Phase Sensitivity for Attacking Large Vision–Language Models.
Daizong Liu, Junhao Dong, Xiang Fang, Hongyang He, Keyan Jin, Zhongliang Guo, Xiaoye Qu, Keke Tang.
The 35th International Joint Conference on Artificial Intelligence, [IJCAI2026] - LearnerCoMPASS: Intelligent Tutoring System with Dynamic Cognitive Diagnosis and Multi-Model Path Planning.
Ziji Sheng, Guiyao Tie, Weidong Wang, Pan Zhou, Daizong Liu#.
The 64rd Annual Meeting of the Association for Computational Linguistics, [ACL2026] - From Part to Whole: 3D Generative World Model with an Adaptive Structural Hierarchy.
Bi’an Du, Daizong Liu*, Pufan Li, Wei Hu.
IEEE International Conference on Multimedia & Expo, [ICME2026] - Are Large Vision-Language Models Robust to Adversarial Visual Transformations?.
Daizong Liu, Xiaowen Cai, Pan Zhou, Xiaoye Qu, Lichao Sun, Wei Hu.
IEEE Transactions on Information Forensics & Security, [TIFS] - CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval.
Xuanzuo Lin, Min Zhang, Daizong Liu#, Zhiwen Zuo, Xun Yang, Changting Lin, Xun Wang, Jianfeng Dong.
IEEE Conference on Computer Vision and Pattern Recognition, [CVPR2026] - Generating Transferable Attacks across Large Vision-Language Models using Adversarial Deformation Learning.
Daizong Liu, Wangqin Liu, Xiaowen Cai, Pan Zhou, Runwei Guan, Xiaoye Qu, Bo Du.
Pattern Recognition, [PR] - Spatial-Spectral Homogeneous Attacks on Physical-World Large Vision-Language Models.
Daizong Liu, Baoquan Chen, Wei Hu.
AAAI Conference on Artificial Intelligence, [AAAI2026]
2025
- Active Cross-Task Knowledge Transfer Learning Framework for Semi-supervised Joint 3D Grounding and Captioning.
Yang Liu, Daizong Liu*, Wei Hu, Baoquan Chen.
IEEE Transactions on Multimedia, [TMM] - PRVR: Partially Relevant Video Retrieval.
Xianke Chen, Daizong Liu, Xun Yang, Xirong Li, Jianfeng Dong, Meng Wang, Xun Wang.
IEEE Transactions on Pattern Analysis and Machine Intelligence, [TPAMI] - Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models.
Xiaowen Cai, Daizong Liu*, Xiaoye Qu, Xiang Fang, Jianfeng Dong, Keke Tang, Pan Zhou, Lichao Sun, Wei Hu.
The Thirty-ninth Annual Conference on Neural Information Processing Systems, [NeurIPS2025][Spotlight] - Fit the Distribution: Cross-Image/Prompt Adversarial Attacks on Multimodal Large Language Models.
Hai Yan, Haijian Ma, Xiaowen Cai, Daizong Liu#, Zenghui Yuan, Xiaoye Qu, Jianfeng Dong, Runwei Guan, Xiang Fang, Hongyang He, Yulai Xie, Pan Zhou.
The Thirty-ninth Annual Conference on Neural Information Processing Systems, [NeurIPS2025] - Misalignment Attack on Text-To-Image Models via Text Embedding Optimization and Inversion.
Zhijie Du, Daizong Liu#, Pan Zhou.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2025] - Learning from Few Samples: A Novel Approach for High-Quality Malcode Generation.
Haijian Ma, Daizong Liu*, Xiaowen Cai, Yulai Xie, Pan Zhou.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2025] - A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends.
Daizong Liu, Mingyu Yang, Xiaoye Qu, Pan Zhou, Yu Cheng, Wei Hu.
IEEE Transactions on Neural Networks and Learning Systems, [TNNLS] - Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval.
Junan Lin, Daizong Liu*, Xianke Chen, Xiaoye Qu, Xun Yang, Jixiang Zhu, Sanyuan Zhang, Jianfeng Dong.
ACM International Conference on Multimedia, [ACMMM2025] - A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions.
Daizong Liu, Yang Liu, Wencan Huang, Wei Hu.
IEEE Transactions on Neural Networks and Learning Systems, [TNNLS] - LLM-assisted Entropy-based Adaptive Distillation for Unsupervised Fine-grained Visual Representation Learning.
Jianfeng Dong, Danfeng Luo, Daizong Liu#, Jie Sun, Xiaoye Qu, Xun Yang, Dongsheng Liu, Xun Wang.
IEEE International Conference on Computer Vision, [ICCV2025] - Imperceptible Beam-Sensitive Adversarial Attacks for LiDAR-based Object Detection in Autonomous Driving.
Fuyao Cai, Daizong Liu#, Xiang Fang, Jixiang Yu, Keke Tang, Pan Zhou.
IEEE International Conference on Multimedia & Expo, [ICME2025] - Seeing is Not Believing: Adversarial Natural Object Optimization for Hard-Label 3D Scene Attacks.
Daizong Liu, Wei Hu.
IEEE Conference on Computer Vision and Pattern Recognition, [CVPR2025]
2024
- Imperceptible Backdoor Attacks on Text-Guided 3D Scene Grounding.
Daizong Liu, Wei Hu.
IEEE Transactions on Multimedia, [TMM] - Pandora’s Box: Towards Building Universal Attackers against Real-World Large Vision-Language Models.
Daizong Liu, Mingyu Yang, Xiaoye Qu, Pan Zhou, Xiang Fang, Keke Tang, Yao Wan, Lichao Sun.
The Thirty-eighth Annual Conference on Neural Information Processing Systems, [NeurIPS2024] - Temporal Sentence Grounding with Relevance Feedback in Videos.
Jianfeng Dong, Xiaoman Peng, Daizong Liu#, Xiaoye Qu, Xun Yang, Cuizhu Bao, Meng Wang.
The Thirty-eighth Annual Conference on Neural Information Processing Systems, [NeurIPS2024] - Frequency-Aware GAN for Imperceptible Transfer Attack on 3D Point Clouds.
Xiaowen Cai, Yunbo Tao, Daizong Liu#, Pan Zhou, Xiaoye Qu, Jianfeng Dong, Keke Tang, Lichao Sun.
ACM International Conference on Multimedia, [ACMMM2024] - Cross-Task Knowledge Transfer for Semi-supervised Joint 3D Grounding and Captioning.
Yang Liu, Daizong Liu*, Zongming Guo, Wei Hu.
ACM International Conference on Multimedia, [ACMMM2024][Oral] - Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval using Language.
Xiang Fang, Wanlong Fang, Daizong Liu*, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Renfu Li, Zichuan Xu, Lixing Chen, Panpan Zheng, Yu Cheng.
ACM International Conference on Multimedia, [ACMMM2024][Oral] - Hiding Imperceptible Noise in Curvature-Aware Patches for 3D Point Cloud Attack.
Mingyu Yang, Daizong Liu*, Keke Tang, Pan Zhou, Lixing Chen, Junyang Chen.
European Conference on Computer Vision, [ECCV2024] - Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective.
Xiang Fang, Zeyu Xiong, Wanlong Fang, Xiaoye Qu, Chen Chen, Jianfeng Dong, Keke Tang, Pan Zhou, Yu Cheng, Daizong Liu#.
European Conference on Computer Vision, [ECCV2024] - Rethinking Video Sentence Grounding from a Tracking Perspective with Memory Network and Masked Attention.
Zeyu Xiong, Daizong Liu*, Xiang Fang, Xiaoye Qu, Jianfeng Dong, Jiahao Zhu, Keke Tang, Pan Zhou.
IEEE Transactions on Multimedia, [TMM] - Towards Robust Temporal Activity Localization Learning with Noisy Labels.
Daizong Liu, Xiaoye Qu, Xiang Fang, Jianfeng Dong, Pan Zhou, Guoshun Nan, Keke Tang, Wanlong Fang, Yu Cheng.
International Conference on Computational Linguistics, [COLING2024] - Explicitly Perceiving and Preserving the Local Geometric Structures for 3D Point Cloud Attack.
Daizong Liu, Wei Hu.
AAAI Conference on Artificial Intelligence, [AAAI2024] - Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language.
Xiang Fang, Daizong Liu*, Wanlong Fang, Pan Zhou, Zichuan Xu, Wenzheng Xu, Junyang Chen, Renfu Li.
AAAI Conference on Artificial Intelligence, [AAAI2024] - Unsupervised Domain Adaptive Temporal Sentence Localization with Mutual Information Maximization.
Daizong Liu, Xiang Fang, Xiaoye Qu, Jianfeng Dong, He Yan, Yang Yang, Pan Zhou, Yu Cheng.
AAAI Conference on Artificial Intelligence, [AAAI2024]
2023
- Point Cloud Attacks in Graph Spectral Domain: When 3D Geometry Meets Graph Signal Processing.
Daizong Liu, Wei Hu, Xin Li.
IEEE Transactions on Pattern Analysis and Machine Intelligence, [TPAMI] - Robust Geometry-Dependent Attack for 3D Point Clouds.
Daizong Liu, Wei Hu, Xin Li.
IEEE Transactions on Multimedia, [TMM] - Transform-Equivariant Consistency Learning for Temporal Sentence Grounding.
Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Zichuan Xu, Haozhao Wang, Xing Di, Weining Lu, Yu Cheng.
ACM Transactions on Multimedia Computing, Communications and Applications, [TOMM] - Conditional Video Diffusion Network for Fine-grained Temporal Sentence Grounding.
Daizong Liu, Jiahao Zhu, Xiang Fang, Zeyu Xiong, Huan Wang, Renfu Li, Pan Zhou.
IEEE Transactions on Multimedia, [TMM] - Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding.
Xiang Fang, Daizong Liu*, Wanlong Fang, Pan Zhou, Yu Cheng, Keke Tang.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2023] - Hierarchical Local-Global Transformer for Temporal Sentence Grounding.
Xiang Fang, Daizong Liu*, Pan Zhou, Zichuan Xu, Ruixuan Li.
IEEE Transactions on Multimedia, [TMM] - Dense Object Grounding in 3D Scenes.
Wencan Huang, Daizong Liu*, Wei Hu.
ACM International Conference on Multimedia, [ACMMM2023] - Unified Multi-modal Unsupervised Representation Learning for Skeleton-based Action Understanding.
Shengkai Sun, Daizong Liu*, Jianfeng Dong, Xiaoye Qu, Junyu Gao, Xun Yang, Xun Wang, Meng Wang.
ACM International Conference on Multimedia, [ACMMM2023] - Filling the Information Gap between Video and Query for Language-Driven Moment Retrieval.
Daizong Liu, Xiaoye Qu, Jianfeng Dong, Guoshun Nan, Pan Zhou, Zichuan Xu, Lixing Chen, He Yan, Yu Cheng.
ACM International Conference on Multimedia, [ACMMM2023] - 3DHacker: Spectrum-based Decision Boundary Generation for Hard-label 3D Point Cloud Attack.
Yunbo Tao, Daizong Liu*, Pan Zhou, Yulai Xie, Wei Du, Wei Hu.
IEEE International Conference on Computer Vision, [ICCV2023] - You Can Ground Earlier than See: An Effective and Efficient Pipeline for Temporal Sentence Grounding in Compressed Video.
Xiang Fang, Daizong Liu*, Pan Zhou, Guoshun Nan.
IEEE Conference on Computer Vision and Pattern Recognition, [CVPR2023] - Exploring Optical-Flow-Guided Motion and Detection-Based Appearance for Temporal Sentence Grounding.
Daizong Liu, Xiang Fang, Wei Hu, Pan Zhou.
IEEE Transactions on Multimedia, [TMM] - Hypotheses Tree Building for One-Shot Temporal Sentence Localization.
Daizong Liu, Xiang Fang, Pan Zhou, Xing Di, Weining Lu, Yu Cheng.
AAAI Conference on Artificial Intelligence, [AAAI2023][Oral]
2022
- Imperceptible Transfer Attack and Defense on 3D Point Cloud Classification.
Daizong Liu, Wei Hu.
IEEE Transactions on Pattern Analysis and Machine Intelligence, [TPAMI] - Few-Shot Temporal Sentence Grounding via Memory-Guided Semantic Learning.
Daizong Liu, Pan Zhou, Zichuan Xu, Haozhao Wang, Ruixuan Li.
IEEE Transactions on Circuits and Systems for Video Technology, [TCSVT] - Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval.
Xiang Fang, Daizong Liu*, Pan Zhou, Yuchong Hu.
IEEE Transactions on Multimedia, [TMM] - Rethinking the Video Sampling and Reasoning Strategies for Temporal Sentence Grounding.
Jiahao Zhu, Daizong Liu*, Pan Zhou, Xing Di, Yu Cheng, Song Yang, Wenzheng Xu, Zichuan Xu, Yao Wan, Lichao Sun, Zeyu Xiong.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2022] - Rethinking Graph Neural Networks for Unsupervised Video Object Segmentation.
Daizong Liu, Wei Hu.
The 33rd British Machine Vision Conference, [BMVC2022] - Learning to Focus on the Foreground for Temporal Sentence Grounding.
Daizong Liu, Wei Hu.
International Conference on Computational Linguistics, [COLING2022] - Exploring the Devil in Graph Spectral Domain for 3D Point Cloud Attacks.
Qianjiang Hu, Daizong Liu*, Wei Hu.
European Conference on Computer Vision, [ECCV2022] - Reducing the Vision and Language Bias for Temporal Sentence Grounding.
Daizong Liu, Xiaoye Qu, Wei Hu.
ACM International Conference on Multimedia, [ACMMM2022][Oral] - Skimming, Locating, then Perusing: A Human-Like Framework for Natural Language Video Localization.
Daizong Liu, Wei Hu.
ACM International Conference on Multimedia, [ACMMM2022] - A Hybird Alignment Loss for Temporal Moment Localization with Natural Language.
Chao Guo, Daizong Liu*, Pan Zhou.
IEEE International Conference on Multimedia & Expo, [ICME2022] - Exploring Motion and Appearance Information for Temporal Sentence Grounding.
Daizong Liu, Xiaoye Qu, Pan Zhou, Yang Liu.
AAAI Conference on Artificial Intelligence, [AAAI2022] - Memory-Guided Semantic Learning Network for Temporal Sentence Grounding.
Daizong Liu, Xiaoye Qu, Xing Di, Yu Cheng, Zichuan Xu, Pan Zhou.
AAAI Conference on Artificial Intelligence, [AAAI2022] - Unsupervised Temporal Video Grounding with Deep Semantic Clustering.
Daizong Liu, Xiaoye Qu, Yinzhen Wang, Xing Di, Kai Zou, Yu Cheng, Zichuan Xu, Pan Zhou.
AAAI Conference on Artificial Intelligence, [AAAI2022]
2021
- Progressively Guide to Attend: An Iterative Alignment Framework for Temporal Sentence Grounding.
Daizong Liu, Xiaoye Qu, Pan Zhou.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2021] - Adaptive Proposal Generation Network for Temporal Sentence Localization in Videos.
Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou.
Conference on Empirical Methods in Natural Language Processing, [EMNLP2021] - Context-aware Biaffine Localizing Network for Temporal Sentence Grounding.
Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Yu Cheng, Wei Wei, Zichuan Xu, Yulai Xie.
IEEE Conference on Computer Vision and Pattern Recognition, [CVPR2021] - F2Net: Learning to Focus on the Foreground for Unsupervised Video Object Segmentation.
Daizong Liu, Dongdong Yu, Changhu Wang, Pan Zhou.
AAAI Conference on Artificial Intelligence, [AAAI2021] - Spatiotemporal Graph Neural Network based Mask Reconstruction for Video Object Segmentation.
Daizong Liu, Shuangjie Xu, Xiao-Yang Liu, Zichuan Xu, Wei Wei, Pan Zhou.
AAAI Conference on Artificial Intelligence, [AAAI2021]
2020
- Reasoning Step-by-Step: Temporal Sentence Localization in Videos via Deep Rectification-Modulation Network.
Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou.
International Conference on Computational Linguistics, [COLING2020] - Jointly Cross-and Self-Modal Graph Attention Network for Query-Based Moment Localization.
Daizong Liu, Xiaoye Qu, Xiao-Yang Liu, Jianfeng Dong, Pan Zhou, Zichuan Xu.
ACM International Conference on Multimedia, [ACMMM2020] - Video-based Facial Expression Recognition using Graph Convolutional Networks.
Daizong Liu, Hongting Zhang, Pan Zhou.
International Conference on Pattern Recognition, [ICPR2020] - SAANet: Siamese action-units attention network for improving dynamic facial expression recognition.
Daizong Liu, Xi Ouyang, Shuangjie Xu, Pan Zhou, Kun He, Shiping Wen.
Neurocomputing, [Neurocomputing]
2019
- MHP-VOS: Multiple hypotheses propagation for video object segmentation.
Shuangjie Xu, Daizong Liu*, Linchao Bao, Wei Liu, Pan Zhou.
IEEE Conference on Computer Vision and Pattern Recognition, [CVPR2019][Oral]
