Shoeleh, F.[Farzaneh],
Asadpour, M.[Masoud],
Graph based skill acquisition and transfer Learning for continuous
reinforcement learning domains,
PRL(87), No. 1, 2017, pp. 104-116.
Elsevier DOI
1703
Reinforcement learning
BibRef
Koo, S.[Sangjun],
Yu, H.[Hwanjo],
Lee, G.G.[Gary Geunbae],
Adversarial approach to domain adaptation for reinforcement learning
on dialog systems,
PRL(128), 2019, pp. 467-473.
Elsevier DOI
1912
Dialog systems, Reinforcement learning, Domain adaptation,
Transfer learning, Deep Q Network, Adversarial networks
BibRef
Agarwal, M.[Mridul],
Aggarwal, V.[Vaneet],
Blind decision making: Reinforcement learning with delayed
observations,
PRL(150), 2021, pp. 176-182.
Elsevier DOI
2109
BibRef
Hwang, R.[Rakhoon],
Lee, H.J.[Han-Jin],
Hwang, H.J.[Hyung Ju],
Option compatible reward inverse reinforcement learning,
PRL(154), 2022, pp. 83-89.
Elsevier DOI
2202
Reinforcement learning, Inverse reinforcement learning,
Transfer learning, Machine learning
BibRef
Nicholaus, I.T.[Isack Thomas],
Kang, D.K.[Dae-Ki],
Robust experience replay sampling for multi-agent reinforcement
learning,
PRL(155), 2022, pp. 135-142.
Elsevier DOI
2203
Reinforcement learning, Multi-agent, Sampling, Experience replay
BibRef
Wang, J.[Jiao],
Zhang, L.[Lemin],
He, Z.Q.[Zhi-Qiang],
Zhu, C.[Can],
Zhao, Z.H.[Zi-Hui],
Erlang planning network: An iterative model-based reinforcement
learning with multi-perspective,
PR(128), 2022, pp. 108668.
Elsevier DOI
2205
Model-based reinforcement learning, Multi-perspective,
Bi-level, Planning, Trajectory imagination
BibRef
Li, M.[Min],
Huang, T.Y.[Tian-Yi],
Zhu, W.[William],
Clustering experience replay for the effective exploitation in
reinforcement learning,
PR(131), 2022, pp. 108875.
Elsevier DOI
2208
Reinforcement learning, Clustering, Experience replay,
Exploitation efficiency, Time division
BibRef
Tosatto, S.[Samuele],
Carvalho, J.[Joăo],
Peters, J.[Jan],
Batch Reinforcement Learning With a Nonparametric Off-Policy Policy
Gradient,
PAMI(44), No. 10, October 2022, pp. 5996-6010.
IEEE DOI
2209
Mathematical model, Estimation, Kernel, Reinforcement learning,
Monte Carlo methods, Task analysis, Closed-form solutions,
nonparametric estimation
BibRef
Guo, S.Q.[Shang-Qi],
Yan, Q.[Qi],
Su, X.[Xin],
Hu, X.L.[Xiao-Lin],
Chen, F.[Feng],
State-Temporal Compression in Reinforcement Learning With the
Reward-Restricted Geodesic Metric,
PAMI(44), No. 9, September 2022, pp. 5572-5589.
IEEE DOI
2208
Measurement, Task analysis, Reinforcement learning,
Neural networks, Time-domain analysis,
reinforcement learning (RL)
BibRef
Xu, T.[Tian],
Li, Z.N.[Zi-Niu],
Yu, Y.[Yang],
Error Bounds of Imitating Policies and Environments for Reinforcement
Learning,
PAMI(44), No. 10, October 2022, pp. 6968-6980.
IEEE DOI
2209
Planning, Reinforcement learning, Cloning, Complexity theory,
Supervised learning, Decision making, Upper bound,
model-based reinforcement learning
BibRef
Li, Y.[Yun],
Liu, Z.[Zhe],
Yao, L.[Lina],
Wang, X.Z.[Xian-Zhi],
McAuley, J.[Julian],
Chang, X.J.[Xiao-Jun],
An Entropy-Guided Reinforced Partial Convolutional Network for
Zero-Shot Learning,
CirSysVideo(32), No. 8, August 2022, pp. 5175-5186.
IEEE DOI
2208
Convolution, Feature extraction, Semantics, Visualization, Training,
Optimization, Kernel, Zero-shot learning, reinforcement learning,
image representation
BibRef
Feng, J.[Jie],
Li, D.[Di],
Gu, J.[Jing],
Cao, X.H.[Xiang-Hai],
Shang, R.H.[Rong-Hua],
Zhang, X.R.[Xiang-Rong],
Jiao, L.C.[Li-Cheng],
Deep Reinforcement Learning for Semisupervised Hyperspectral Band
Selection,
GeoRS(60), 2022, pp. 1-19.
IEEE DOI
2112
Hyperspectral imaging, Reinforcement learning, Optimization,
Deep learning, Task analysis, Neural networks,
semisupervised learning
BibRef
Akrour, R.[Riad],
Tateo, D.[Davide],
Peters, J.[Jan],
Continuous Action Reinforcement Learning From a Mixture of
Interpretable Experts,
PAMI(44), No. 10, October 2022, pp. 6795-6806.
IEEE DOI
2209
Task analysis, Complexity theory, Approximation algorithms,
Neural networks, Trajectory, Reinforcement learning,
robotics
BibRef
Zhang, M.Y.[Meng-Yang],
Tian, G.H.[Guo-Hui],
Gao, H.B.[Huan-Bing],
Zhang, Y.[Ying],
Autonomous Generation of Service Strategy for Household Tasks:
A Progressive Learning Method With A Priori Knowledge and Reinforcement
Learning,
CirSysVideo(32), No. 11, November 2022, pp. 7473-7488.
IEEE DOI
2211
Correlation, Task analysis, Reinforcement learning,
Artificial neural networks.
BibRef
Li, W.H.[Wen-Hao],
Wang, X.F.[Xiang-Feng],
Jin, B.[Bo],
Luo, D.[Dijun],
Zha, H.Y.[Hong-Yuan],
Structured Cooperative Reinforcement Learning With Time-Varying
Composite Action Space,
PAMI(44), No. 11, November 2022, pp. 8618-8634.
IEEE DOI
2210
Agriculture, Task analysis,
Reinforcement learning, Games, Carbon dioxide, Robustness,
time-varying action space
BibRef
Zhu, R.[Rongbo],
Li, M.Y.[Meng-Yao],
Liu, H.[Hao],
Liu, L.[Lu],
Ma, M.[Maode],
Federated Deep Reinforcement Learning-Based Spectrum Access Algorithm
With Warranty Contract in Intelligent Transportation Systems,
ITS(24), No. 1, January 2023, pp. 1178-1190.
IEEE DOI
2301
Contracts, Warranties, Resource management, Quality of service,
Real-time systems, Heuristic algorithms, Vehicle dynamics, quality of service
BibRef
Hu, T.M.[Tian-Meng],
Luo, B.[Biao],
Yang, C.H.[Chun-Hua],
Huang, T.W.[Ting-Wen],
MO-MIX: Multi-Objective Multi-Agent Cooperative Decision-Making With
Deep Reinforcement Learning,
PAMI(45), No. 10, October 2023, pp. 12098-12112.
IEEE DOI
2310
BibRef
Zhao, L.Y.[Lin-Ya],
Tan, K.[Kun],
Wang, X.[Xue],
Ding, J.W.[Jian-Wei],
Liu, Z.X.[Zhao-Xian],
Ma, H.L.[Hui-Lin],
Han, B.[Bo],
Hyperspectral Feature Selection for SOM Prediction Using Deep
Reinforcement Learning and Multiple Subset Evaluation Strategies,
RS(15), No. 1, 2023, pp. xx-yy.
DOI Link
2301
BibRef
Huang, F.X.[Fu-Xian],
Ji, N.[Naye],
Ni, H.J.[Hua-Jian],
Li, S.J.[Shi-Jian],
Li, X.[Xi],
Adaptive cooperative exploration for reinforcement learning from
imperfect demonstrations,
PRL(165), 2023, pp. 176-182.
Elsevier DOI
2301
Reinforcement learning, Imitation learning,
Cooperative exploration, Imperfect demonstrations,
BibRef
Huang, F.X.[Fu-Xian],
Li, W.C.[Wei-Chao],
Cui, J.B.[Jia-Bao],
Fu, Y.J.[Yong-Jian],
Li, X.[Xi],
Unified Curiosity-Driven Learning with Smoothed Intrinsic Reward
Estimation,
PR(123), 2022, pp. 108352.
Elsevier DOI
2112
Reinforcement learning, Unified curiosity-driven exploration,
Robust intrinsic reward, Task-relevant feature
BibRef
Gomez, D.[Diego],
Quijano, N.[Nicanor],
Giraldo, L.F.[Luis Felipe],
Information Optimization and Transferable State Abstractions in Deep
Reinforcement Learning,
PAMI(45), No. 4, April 2023, pp. 4782-4793.
IEEE DOI
2303
Task analysis, Reinforcement learning, Multitasking,
Transfer learning, Optimization, Standards, Behavioral sciences,
information theory
BibRef
Zhu, Z.D.[Zhuang-Di],
Lin, K.X.[Kai-Xiang],
Jain, A.K.[Anil K.],
Zhou, J.Y.[Jia-Yu],
Transfer Learning in Deep Reinforcement Learning: A Survey,
PAMI(45), No. 11, November 2023, pp. 13344-13362.
IEEE DOI
2310
Survey, Transfer Learning.
BibRef
Saengkyongam, S.[Sorawit],
Thams, N.[Nikolaj],
Peters, J.[Jonas],
Pfister, N.[Niklas],
Invariant Policy Learning: A Causal Perspective,
PAMI(45), No. 7, July 2023, pp. 8606-8620.
IEEE DOI
2306
Training, Visualization, Reinforcement learning, Random variables,
Particle measurements, Heuristic algorithms, off-policy learning
BibRef
Huang, H.C.[Han-Chi],
Ye, D.H.[De-Heng],
Shen, L.[Li],
Liu, W.[Wei],
Curriculum-Based Asymmetric Multi-Task Reinforcement Learning,
PAMI(45), No. 6, June 2023, pp. 7258-7269.
IEEE DOI
2305
Task analysis, Training, Multitasking, Reinforcement learning,
Optimization, Interference, Supervised learning,
asymmetric multi-task learning
BibRef
Zhang, T.R.[Tian-Ren],
Guo, S.Q.[Shang-Qi],
Tan, T.[Tian],
Hu, X.L.[Xiao-Lin],
Chen, F.[Feng],
Adjacency Constraint for Efficient Hierarchical Reinforcement
Learning,
PAMI(45), No. 4, April 2023, pp. 4152-4166.
IEEE DOI
2303
Task analysis, Reinforcement learning, Training, Random variables,
Postal services, Markov processes, Games, adjacency constraint
BibRef
Deng, Z.H.[Zhi-Hong],
Fu, Z.[Zuyue],
Wang, L.X.[Ling-Xiao],
Yang, Z.R.[Zhuo-Ran],
Bai, C.J.[Chen-Jia],
Zhou, T.Y.[Tian-Yi],
Wang, Z.R.[Zhao-Ran],
Jiang, J.[Jing],
False Correlation Reduction for Offline Reinforcement Learning,
PAMI(46), No. 2, February 2024, pp. 1199-1211.
IEEE DOI
2401
False correlation, offline reinforcement learning, uncertainty estimation
BibRef
Zhang, L.Y.[Liang-Yu],
Peng, Y.[Yang],
Yang, W.H.[Wen-Hao],
Zhang, Z.H.[Zhi-Hua],
Semi-Infinitely Constrained Markov Decision Processes and Provably
Efficient Reinforcement Learning,
PAMI(46), No. 5, May 2024, pp. 3722-3735.
IEEE DOI
2404
Generalization of constrained Markov decision processes.
Reinforcement learning, Complexity theory, Programming,
Markov processes, Approximation algorithms, Marine vehicles, Costs,
semi-infinitely programming
BibRef
Rodrigues-da Silva, J.A.[Júnior Anderson],
Grassi, V.[Valdir],
Wolf, D.F.[Denis Fernando],
Maximum Entropy Inverse Reinforcement Learning Using Monte Carlo Tree
Search for Autonomous Driving,
ITS(25), No. 9, September 2024, pp. 11552-11562.
IEEE DOI
2409
Trajectory, Behavioral sciences, Entropy, Autonomous vehicles,
Vehicles, Cost function, Task analysis, Autonomous vehicles, merging, IRL
BibRef
Pang, T.[Teng],
Wu, G.Q.[Guo-Qiang],
Zhang, Y.[Yan],
Wang, B.Z.[Bing-Zheng],
Yin, Y.L.[Yi-Long],
QFAE: Q-Function guided Action Exploration for offline deep
reinforcement learning,
PR(158), 2025, pp. 111032.
Elsevier DOI
2411
Deep reinforcement learning, Offline reinforcement learning,
Policy constraints, Action exploration, D4RL
BibRef
Zheng, W.Q.[Wen-Qing],
Sharan, S.P.,
Fan, Z.W.[Zhi-Wen],
Wang, K.[Kevin],
Xi, Y.H.[Yi-Han],
Wang, Z.Y.[Zhang-Yang],
Symbolic Visual Reinforcement Learning: A Scalable Framework With
Object-Level Abstraction and Differentiable Expression Search,
PAMI(47), No. 1, January 2025, pp. 400-412.
IEEE DOI
2412
Visualization, Optimization, Reinforcement learning,
Representation learning, Neural networks, Vegetation, Planning,
visual reinforcement learning (RL)
BibRef
Liu, Y.Q.[Ya-Qiong],
Zhao, T.Y.[Tong-Yu],
Shou, G.[Guochu],
Zhang, Y.[Yan],
Joint Optimization of Latency and Energy Consumption via Deep
Reinforcement Learning for Proximity Detection in Road Networks,
ITS(25), No. 12, December 2024, pp. 19457-19468.
IEEE DOI
2412
Optimization, Servers, Energy consumption,
Roads, Costs, Heuristic algorithms, Computational modeling,
Internet of Vehicles (IoV)
BibRef
Lee, S.H.[Sang-Hyun],
Jung, Y.[Yoonjae],
Seo, S.W.[Seung-Woo],
Imagination-Augmented Hierarchical Reinforcement Learning for Safe
and Interactive Autonomous Driving in Urban Environments,
ITS(25), No. 12, December 2024, pp. 19522-19535.
IEEE DOI
2412
Autonomous Vehicles. Navigation, Attention mechanisms, Autonomous vehicles,
Reinforcement learning, Heuristic algorithms, Standards, navigation
BibRef
Liu, S.[Shunyu],
Qing, Y.P.[Yun-Peng],
Xu, S.Q.[Shu-Qi],
Wu, H.Y.[Hong-Yan],
Zhang, J.T.[Jiang-Tao],
Cong, J.Y.[Jing-Yuan],
Chen, T.H.[Tian-Hao],
Liu, Y.F.[Yun-Fu],
Song, M.L.[Ming-Li],
Curricular Subgoals for Inverse Reinforcement Learning,
ITS(26), No. 3, March 2025, pp. 3016-3027.
IEEE DOI Code:
WWW Link.
2503
Training, Trajectory, Reinforcement learning, Uncertainty, Optimization,
Imitation learning, Blockchains, Benchmark testing, reward function
BibRef
Wang, J.[Jie],
Ye, M.X.[Ming-Xuan],
Kuang, Y.F.[Yu-Fei],
Yang, R.[Rui],
Zhou, W.G.[Wen-Gang],
Li, H.Q.[Hou-Qiang],
Wu, F.[Feng],
Long-Term Feature Extraction via Frequency Prediction for Efficient
Reinforcement Learning,
PAMI(47), No. 4, April 2025, pp. 3094-3110.
IEEE DOI
2503
Predictive models, Frequency-domain analysis, Feature extraction,
Accuracy, Representation learning, Trajectory, Fourier transforms,
fourier transform
BibRef
Duan, J.L.[Jing-Liang],
Wang, W.X.[Wen-Xuan],
Xiao, L.M.[Li-Ming],
Gao, J.X.[Jia-Xin],
Li, S.B.E.[Sheng-Bo Eben],
Liu, C.[Chang],
Zhang, Y.Q.[Ya-Qin],
Cheng, B.[Bo],
Li, K.Q.[Ke-Qiang],
Distributional Soft Actor-Critic With Three Refinements,
PAMI(47), No. 5, May 2025, pp. 3935-3946.
IEEE DOI
2504
Standards, Estimation, Accuracy, Sensitivity, Stability analysis,
Random variables, Q-learning, Tuning, Probability distribution,
reinforcement learning
BibRef
Liu, Z.C.[Zi-Chuan],
Zhu, Y.Y.[Yuan-Yang],
Wang, Z.[Zhi],
Gao, Y.[Yang],
Chen, C.L.[Chun-Lin],
MIXRTs: Toward Interpretable Multi-Agent Reinforcement Learning via
Mixing Recurrent Soft Decision Trees,
PAMI(47), No. 5, May 2025, pp. 4090-4107.
IEEE DOI
2504
Decision trees, History, Q-learning, Training, Visualization,
Decision making, Knowledge engineering, Data mining, Closed box,
value decomposition
BibRef
Liu, W.D.[Wei-Dong],
Ma, J.H.[Jia-Hua],
Mao, X.J.[Xiao-Jun],
Tang, K.[Kejie],
A New Accelerated Off-Policy Stochastic Preconditioned TD(0)
Algorithm,
PAMI(47), No. 9, September 2025, pp. 8088-8101.
IEEE DOI
2508
Convergence, Vectors, Function approximation, Monte Carlo methods,
Approximation algorithms, Kernel, Estimation, Training,
temporal-difference learning
BibRef
Pi, B.[Bin],
Deng, L.J.[Liang-Jian],
Feng, M.[Minyu],
Perc, M.[Matjaž],
Kurths, J.[Jürgen],
Dynamic Evolution of Complex Networks: A Reinforcement Learning
Approach Applying Evolutionary Games to Community Structure,
PAMI(47), No. 10, October 2025, pp. 8563-8582.
IEEE DOI
2510
Complex networks, Games, Analytical models,
Exponential distribution, Evolution (biology), Q-learning,
stochastic process
BibRef
Yuan, C.Q.[Chang-Qing],
Xie, Y.F.[Yong-Fang],
Xie, S.[Shiwen],
Tang, Z.H.[Zhao-Hui],
Wu, Z.Z.[Zong-Ze],
Aggregated masked autoencoding for offline reinforcement learning,
PRL(197), 2025, pp. 312-318.
Elsevier DOI
2510
Offline reinforcement learning, Decision making,
Self-supervised learning, Conditional sequence modeling
BibRef
Du, W.[Wei],
Chen, Z.[Zhengfan],
Ding, S.F.[Shi-Fei],
Zhang, C.L.[Cheng-Long],
Guo, W.[Wei],
Sun, Y.Q.[Yu-Qing],
Yu, G.X.[Guo-Xian],
Cui, L.Z.[Li-Zhen],
Learning multi-agent communication via graph contrastive learning,
PR(171), 2026, pp. 112093.
Elsevier DOI
2510
Multi-agent reinforcement learning, Graph neural networks,
Communication learning
BibRef
Ma, G.Z.[Guo-Zheng],
Wang, Z.[Zhen],
Yuan, Z.C.[Zhe-Cheng],
Wang, X.Q.[Xue-Qian],
Yuan, B.[Bo],
Tao, D.C.[Da-Cheng],
A Comprehensive Survey of Data Augmentation in Visual Reinforcement
Learning,
IJCV(133), No. 10, October 2025, pp. 7368-7405.
Springer DOI
2511
BibRef
Zhang, F.[Fei],
Yang, G.H.[Guang-Hong],
Safe Reinforcement Learning for Constrained Optimal Control With
Provable Guarantees: Applications to Motion Planning,
ITS(26), No. 10, October 2025, pp. 14780-14791.
IEEE DOI
2511
Safety, Trajectory, Optimal control, Real-time systems, Planning,
Convergence, Optimization, Autonomous vehicles, online learning
BibRef
Li, X.[Xulong],
Huangfu, W.[Wei],
Xu, X.[Xinyi],
Huo, J.H.[Jia-Hao],
Long, K.P.[Ke-Ping],
Attention-Driven MARL for AoI Minimization in UAV-Assisted
Intelligent Transport Systems,
ITS(26), No. 11, November 2025, pp. 20348-20362.
IEEE DOI
2511
Age of Information. Need current data.
Multi Agent Reinforcement Learning.
Autonomous aerial vehicles, Data collection,
Attention mechanisms, Minimization, Sensors, Real-time systems
BibRef
Liu, Z.Y.[Zi-Yuan],
Zhuang, Y.[Yan],
Wu, P.[Peng],
Liu, Y.C.[Yuan-Chang],
IRIS: An information path planning method based on reinforcement
learning and information-directed sampling,
PR(172), 2026, pp. 112400.
Elsevier DOI Code:
WWW Link.
2512
Informative path planning, Information-directed sampling, Reinforcement learning
BibRef
Zhu, G.F.[Guo-Feng],
Zhu, F.[Fei],
Action adversarial robust reinforcement learning via Stackelberg game,
PR(172), 2026, pp. 112580.
Elsevier DOI
2512
Robust reinforcement learning, Stackelberg game,
Bi-level optimization, Action space attack
BibRef
Taschin, F.[Federico],
Lazraq, A.[Abderrahmane],
Ozgunes, I.[Inci],
Tonguz, O.K.[Ozan K.],
The Distribution Shift Problem in Transportation Networks Using
Reinforcement Learning and AI,
ITS(26), No. 12, December 2025, pp. 22704-22715.
IEEE DOI
2512
Training, Neural networks, Adaptation models,
Deep reinforcement learning, Data models, Heuristic algorithms,
distributional shift
BibRef
Chen, X.[Xing],
Chen, H.C.[He-Chang],
Chang, Y.[Yi],
Compact exploration for continuous action reinforcement learning,
PR(172), 2026, pp. 112739.
Elsevier DOI
2601
Optimistic critic, Compact exploration,
Continuous action space, Deep reinforcement learning
BibRef
Jiang, K.[Ke],
Jiang, W.[Wen],
Yao, L.[Li],
Tan, X.Y.[Xiao-Yang],
Beyond non-expert demonstrations:
Outcome-driven action constraint for offline reinforcement learning,
PR(172), 2026, pp. 112663.
Elsevier DOI
2601
Offline reinforcement learning, Non-expert data,
Outcome-driven constraint, Trajectory stitching
BibRef
Fan, Y.X.[Yi-Xin],
Peng, H.X.[Hai-Xia],
Su, Z.[Zhou],
Li, Z.D.[Zhen-Dong],
Luan, T.H.[Tom H.],
Proactive Collaborative Perception for CAVs:
A Multi-Agent Reinforcement Learning Method,
ITS(27), No. 1, January 2026, pp. 270-285.
IEEE DOI
2601
Accuracy, Feature extraction, Sensors, Point cloud compression,
Real-time systems, Optimization, Mathematical models, Laser radar,
resource allocation
BibRef
Chen, L.[Lin],
Mo, Y.[Yang],
Wang, Y.N.[Yao-Nan],
Miao, Z.Q.[Zhi-Qiang],
Zeng, K.[Kai],
Feng, M.T.[Ming-Tao],
Zhou, Z.[Zhen],
Wang, S.[Sifei],
Wang, D.[Danwei],
Self-Expert Imitation With Purifying Latent Feature for
Generalization in Visual Reinforcement Learning,
ITS(27), No. 1, January 2026, pp. 960-971.
IEEE DOI
2601
Training, Reinforcement learning, Feature extraction, Visualization,
Data augmentation, Neural networks, Data models, MDP
BibRef
Chi, H.T.[Hao-Tian],
Liu, Z.[Zhaogeng],
Chen, X.[Xing],
Qu, B.[Bohao],
Hu, J.F.[Ji-Feng],
Jiang, Y.[Yuan],
Chen, H.[Hechang],
Chang, Y.[Yi],
State transition difference prediction for deep reinforcement
learning,
PR(173), 2026, pp. 112824.
Elsevier DOI
2601
Reinforcement learning, State representation learning,
Forward prediction, Temporal difference operation
BibRef
Kan, N.[Nuowen],
Li, C.L.[Cheng-Lin],
Jiang, Y.K.[Yuan-Kun],
Dai, W.R.[Wen-Rui],
Zou, J.[Junni],
Xiong, H.K.[Hong-Kai],
Toni, L.[Laura],
MERINA+: Improving Generalization for Neural Video Adaptation via
Information-Theoretic Meta-Reinforcement Learning,
CirSysVideo(36), No. 1, January 2026, pp. 1185-1202.
IEEE DOI
2602
Throughput, Heuristic algorithms, Videos, Quality of experience,
Bit rate, Training, Adaptation models, Inference algorithms,
variational information bottleneck
BibRef
Bao, Q.Y.[Qian-Yue],
Liu, F.[Fang],
Jiao, L.C.[Li-Cheng],
Liu, Y.[Yang],
Li, S.[Shuo],
Li, L.L.[Ling-Ling],
Liu, X.[Xu],
Chen, P.[Puhua],
Ma, W.P.[Wen-Ping],
ERFC: Energy-Aware Reinforcement Feedback Calibration for Zero-Shot
Captioning,
CirSysVideo(36), No. 2, February 2026, pp. 2232-2246.
IEEE DOI
2602
Videos, Training, Adaptation models, Visualization, Calibration,
Data models, Training data, Reinforcement learning, Optimization,
reinforcement feedback
BibRef
Shi, Y.C.[Yu-Chen],
Duan, S.H.[Shi-Hong],
Xu, C.[Cheng],
Wang, R.[Ran],
Ye, F.[Fangwen],
Yuen, C.[Chau],
Dynamic Deep Factor Graph for Multi-Agent Reinforcement Learning,
PAMI(48), No. 3, March 2026, pp. 3417-3431.
IEEE DOI
2602
Heuristic algorithms, Collaboration, Vehicle dynamics,
Optimization, Matrix decomposition, Approximation algorithms,
dynamic collaboration
BibRef
Yu, J.Y.[Ji-Yao],
Zhu, B.[Bin],
Chen, Y.[Yi],
Xie, B.[Bo],
Feng, X.L.[Xuan-Ling],
Yan, H.F.[Hong-Fei],
Zeng, J.[Jian],
Wang, R.H.[Run-Hua],
Intelligent Acquisition of Dynamic Targets via Multi-Source
Information: A Fusion Framework Integrating Deep Reinforcement
Learning with Evidence Theory,
RS(18), No. 5, 2026, pp. 689.
DOI Link
2603
BibRef
Sun, X.Y.[Xin-Yu],
Li, B.[Bing],
Lang, C.Y.[Cong-Yan],
Zhao, Z.K.[Zhi-Kun],
Wang, J.[Juan],
Xiong, W.H.[Wei-Hua],
Hu, W.M.[Wei-Ming],
Cheng, L.[Long],
Reinforcement Learning-Based Sequential Parameter Tuning for Image
Signal Processing,
PAMI(48), No. 4, April 2026, pp. 4114-4131.
IEEE DOI
2603
Tuning, Hardware, Artificial intelligence, Pipelines, Optimization,
Training data, Reinforcement learning, Image quality,
sequential parameter tuning
BibRef
Gao, E.[Enting],
Zha, Z.[Zian],
Li, Y.G.[Yong-Gang],
Zhu, J.H.[Jun-Hui],
Wang, Y.[Yong],
Chen, X.J.[Xin-Jian],
Zhou, N.[Naihui],
Xiang, D.[Dehui],
Amplitude-guided deep reinforcement learning for semi-supervised
layer segmentation,
PR(176), 2026, pp. 113204.
Elsevier DOI
2603
Deep reinforcement learning, Semi-supervised layer segmentation,
Cross-power spectrum correlation
BibRef
Hu, J.F.[Ji-Feng],
Sun, Y.C.[Yan-Chao],
Huang, S.[Sili],
Guo, S.Y.[Si-Yuan],
Chen, H.[Hechang],
Shen, L.[Li],
Sun, L.C.[Li-Chao],
Chang, Y.[Yi],
Tao, D.C.[Da-Cheng],
Instructed Diffuser With Temporal Condition Guidance for Offline
Reinforcement Learning,
PAMI(48), No. 5, May 2026, pp. 5346-5356.
IEEE DOI
2604
Diffusion models, Decision making, Transformers, Trajectory,
Reinforcement learning, Planning, Noise reduction,
conditional generation
BibRef
Li, T.X.[Tian-Xu],
Zhu, K.[Kun],
Efficient Exploration for Multi-Agent Diversity With Agent Identity,
PAMI(48), No. 5, May 2026, pp. 5460-5473.
IEEE DOI
2604
Trajectory, Entropy, Mutual information, Lower bound, Training,
Vectors, Reinforcement learning, Diversity methods, Overfitting,
agent identity
BibRef
Liu, H.C.[Hao-Chen],
Li, T.Y.[Tian-Yu],
Yang, H.H.[Hao-Han],
Chen, L.[Li],
Wang, C.[Caojun],
Guo, K.[Ke],
Tian, H.C.[Hao-Chen],
Li, H.C.[Hong-Chen],
Li, H.Y.[Hong-Yang],
Lv, C.[Chen],
Reinforced Refinement With Self-Aware Expansion for End-to-End
Autonomous Driving,
PAMI(48), No. 5, May 2026, pp. 5774-5792.
IEEE DOI
2604
Adaptation models, Self-aware, Autonomous vehicles, Pipelines, Planning,
Training, Reinforcement learning, Uncertainty, Data models, motion planning
BibRef
Wang, H.[Hao],
Li, W.R.[Wen-Rui],
Wang, P.H.[Peng-Hong],
Zhang, X.Q.[Xian-Qi],
Fan, X.P.[Xiao-Peng],
Hierarchical Neural Skill-Based Meta-Reinforcement Learning for
Efficient Adaptability in Robotic Manipulation Tasks,
SPLetters(33), 2026, pp. 1741-1745.
IEEE DOI
2605
Feedback, Circuits, Protocols, Communication systems,
Local area networks, Data communication, Videos, Message systems,
robotic manipulation task
BibRef
Xu, M.[Meng],
Wen, Z.[Zihao],
Chen, X.H.[Xin-Hong],
Zhao, G.[Guanyi],
Huang, J.[Jin],
Wang, J.P.[Jian-Ping],
A Generic Competitive-Cooperative Actor-Critic Framework for Deep
Reinforcement Learning,
PAMI(48), No. 6, June 2026, pp. 7112-7128.
IEEE DOI
2605
Estimation, Collaboration, Accuracy, Training, Navigation, Measurement,
Limiting, Energy management, Deep reinforcement learning,
competition and cooperation
BibRef
Liu, K.[Kai],
Zhang, T.X.[Tian-Xian],
Kong, L.J.[Ling-Jiang],
Xu, X.L.[Xiang-Liang],
Value decomposition with maximum correntropy for multi-agent deep
reinforcement learning,
PR(178), 2026, pp. 113318.
Elsevier DOI
2605
Value decomposition, Multi-agent deep reinforcement learning,
Robust regression, Maximum correntropy criterion
BibRef
Ren, J.J.[Jiao-Jiao],
Luo, R.[Renfu],
Wu, C.[Cong],
Event-Triggered Reinforcement Learning Control for Switching Fuzzy
Vehicle Lateral Dynamics,
ITS(27), No. 5, May 2026, pp. 5104-5116.
IEEE DOI
2605
Switches, Vehicle dynamics, Event detection,
Reinforcement learning, Control systems, Adaptation models,
frequent switching
BibRef
Zhang, C.[Chi],
Long, T.T.[Ting-Ting],
Wang, Z.D.[Zhen-Dong],
Xu, L.H.[Lin-Hai],
Bi, M.W.[Ming-Wen],
Chen, X.Y.[Xing-Yu],
Liu, Y.H.[Yue-Hu],
Ye, Q.[Qing],
Li, L.[Li],
Perception-Failure-Induced Test Scenario Searching via Online Causal
Reinforcement Learning,
ITS(27), No. 6, June 2026, pp. 6759-6774.
IEEE DOI
2606
Testing, Safety, Autonomous vehicles, Reinforcement learning,
Optical character recognition, Cognition, Standards, Snow,
online learning
BibRef
Sun, X.[Xiao],
Zhu, F.[Fei],
Robust reinforcement learning with State-Driven Dual-Mode Alternating
Adversarial Training via temporal bounded attacks,
PR(179), 2026, pp. 113524.
Elsevier DOI
2606
Robust reinforcement learning, Adversarial training,
State perturbation, Time-constrained setting, Dual mode adversary
BibRef
Zhao, T.[Tianchi],
Liu, H.[He],
Li, J.[Jing],
Liu, Y.C.[Yan-Chao],
Shi, H.Y.[Hong-Yin],
Zhao, G.Z.[Guang-Zhe],
Li, J.L.[Jin-Liang],
Fast online learning algorithm based on modified hierarchical
Unimodal Thompson Sampling,
PR(179), 2026, pp. 113523.
Elsevier DOI
2606
MAB, Unimodal bandits, Reinforcement learning
BibRef
He, H.Y.[Heng-Yang],
Zhang, L.[Le],
Zhu, C.[Ce],
GeoRL: Adaptive tokenization via reinforcement learning for remote
sensing foundation models,
PR(179), 2026, pp. 113874.
Elsevier DOI
2606
Vision Foundation Models, Adaptive tokenization,
Reinforcement learning, Remote sensing,
Proximal Policy Optimization
BibRef
Mao, Y.[Yudi],
Zheng, X.[Xiujuan],
Tu, H.Y.[Hai-Yan],
VATE: Variational Attention Trajectory Encoder for Preference-Based
Reinforcement Learning,
SPLetters(33), 2026, pp. 2460-2464.
IEEE DOI
2607
Modeling, Reinforcement learning, Labeling, Transformers, Windows,
Training, Noise measurement, Learning (artificial intelligence),
multi-scale attention aggregation
BibRef
Pang, T.[Teng],
Wang, B.Z.[Bing-Zheng],
Wu, G.Q.[Guo-Qiang],
Yin, Y.L.[Yi-Long],
Diffusion classifier-driven reward for offline preference-based
reinforcement learning,
PR(180), 2026, pp. 114098.
Elsevier DOI
2608
Offline preference-based reinforcement learning, Reward model, Diffusion model
BibRef
Ameur, M.E.[Mohamed El_Amine],
Brik, B.[Bouziane],
Drias, H.[Habiba],
Ameur, M.[Mazene],
Foufou, S.[Sebti],
Zomaya, A.[Albert],
Deep Reinforcement Learning for Cooperative Intelligent
Transportation Systems: A Survey on Architecture, Use Cases, and
Future Directions,
ITS(27), No. 8, August 2026, pp. 8960-8981.
IEEE DOI
2608
Modeling, Vehicles, Surveys, Deep reinforcement learning, Roads,
Technology, Transportation, Learning (artificial intelligence),
vehicle-to-everything (V2X)
BibRef
Cao, W.[Wen],
Zhang, Y.[Yinbao],
Li, R.S.[Run-Sheng],
Ren, L.Q.[Li-Qiu],
Chen, H.[He],
Progressive Reinforcement Learning for Point-Feature Label Placement
in Map Annotation,
IJGI(15), No. 4, 2026, pp. 162.
DOI Link
2605
BibRef
Koga, K.C.[Kenji Cari],
Kawakami, R.[Rei],
Implicit Object Recognition via Reinforcement Learning in
Out-Of-Domain Scenarios,
ICIP25(451-456)
IEEE DOI
2601
Visualization, Adaptation models, Computational modeling, Object detection,
Reinforcement learning, Reinforcement Learning
BibRef
Babu, A.R.[Ashwin Ramesh],
Mousavi, S.[Sajad],
Gundecha, V.[Vineet],
Ghorbanpour, S.[Sahand],
Naug, A.[Avisek],
Guillen, A.[Antonio],
Gutierrez, R.L.[Ricardo Luna],
Sarkar, S.[Soumyendu],
Robustness Evaluation for Video Models with Reinforcement Learning,
SAIAD25(4362-4370)
IEEE DOI
2512
Threat modeling, Measurement, Computational modeling,
Perturbation methods, Reinforcement learning, Distortion,
Videos
BibRef
Hao, C.J.[Chen-Jie],
Lu, W.[Weyl],
Xu, Y.F.[Yi-Fan],
Chen, Y.[Yubei],
Neural Motion Simulator Pushing the Limit of World Models in
Reinforcement Learning,
CVPR25(27608-27617)
IEEE DOI
2508
Accuracy, Heuristic algorithms, Dynamics, Zero shot learning,
Reinforcement learning, Transforms, Predictive models,
neural ODE
BibRef
Croitoru, F.A.[Florinel-Alin],
Hondru, V.[Vlad],
Ionescu, R.T.[Radu Tudor],
Sebe, N.[Nicu],
Shah, M.[Mubarak],
Curriculum Direct Preference Optimization for Diffusion and
Consistency Models,
CVPR25(2824-2834)
IEEE DOI Code:
WWW Link.
2508
Training, Measurement, Text to image, Reinforcement learning,
Performance gain, Diffusion models, Numerical models, Optimization,
consistencu models
BibRef
Sengupta, K.[Kathakoli],
Shangguan, Z.K.[Zhong-Kai],
Bharadwaj, S.[Sandesh],
Arora, S.[Sanjay],
Ohn-Bar, E.[Eshed],
Mancuso, R.[Renato],
Unified Local-cloud Decision-making via Reinforcement Learning,
ECCV24(XLI: 185-203).
Springer DOI
2412
BibRef
Li, Q.F.[Qi-Feng],
Jia, X.S.[Xiao-Song],
Wang, S.B.[Shao-Bo],
Yan, J.C.[Jun-Chi],
Think2drive: Efficient Reinforcement Learning by Thinking with Latent
World Model for Autonomous Driving (in Carla-v2),
ECCV24(XLV: 142-158).
Springer DOI
2412
BibRef
Zhang, Y.[Yinan],
Tzeng, E.[Eric],
Du, Y.L.[Yi-Lun],
Kislyuk, D.[Dmitry],
Large-scale Reinforcement Learning for Diffusion Models,
ECCV24(LXIII: 1-17).
Springer DOI
2412
BibRef
Guo, T.[Taian],
Zhang, T.[Taolin],
Wu, H.Q.[Hao-Qian],
Li, H.[Hanjun],
Qiao, R.Z.[Rui-Zhi],
Sun, X.[Xing],
Multimodal Label Relevance Ranking via Reinforcement Learning,
ECCV24(LXVI: 391-408).
Springer DOI
2412
BibRef
Tran, T.[Tung],
Than, K.[Khoat],
Vargas, D.[Danilo],
Robust Visual Reinforcement Learning by Prompt Tuning,
ACCV24(IX: 387-401).
Springer DOI
2412
BibRef
Zhang, Y.X.[Yuan-Xin],
Ma, H.M.[Hui-Min],
Wang, Y.[Yu],
AVD-Net: Attention Value Decomposition Network For Deep Multi-Agent
Reinforcement Learning,
ICPR21(7810-7816)
IEEE DOI
2105
Training, Scalability, Reinforcement learning, Games,
Markov processes, Machine translation
BibRef
Choi, H.[Hyesong],
Lee, H.[Hunsang],
Song, W.[Wonil],
Jeon, S.[Sangryul],
Sohn, K.H.[Kwang-Hoon],
Min, D.B.[Dong-Bo],
Local-Guided Global: Paired Similarity Representation for Visual
Reinforcement Learning,
CVPR23(15072-15082)
IEEE DOI
2309
BibRef
Huang, Y.R.[Yang-Ru],
Peng, P.X.[Pei-Xi],
Zhao, Y.F.[Yi-Fan],
Zhai, Y.P.[Yun-Peng],
Xu, H.R.[Hao-Ran],
Tian, Y.H.[Yong-Hong],
Simoun: Synergizing Interactive Motion-appearance Understanding for
Vision-based Reinforcement Learning,
ICCV23(176-185)
IEEE DOI
2401
BibRef
Zhai, Y.P.[Yun-Peng],
Peng, P.X.[Pei-Xi],
Zhao, Y.F.[Yi-Fan],
Huang, Y.R.[Yang-Ru],
Tian, Y.H.[Yong-Hong],
Stabilizing Visual Reinforcement Learning via Asymmetric Interactive
Cooperation,
ICCV23(207-216)
IEEE DOI
2401
BibRef
Choi, H.[Hyesong],
Lee, H.[Hunsang],
Jeong, S.W.[Seong-Won],
Min, D.B.[Dong-Bo],
Environment Agnostic Representation for Visual Reinforcement learning,
ICCV23(263-273)
IEEE DOI Code:
WWW Link.
2401
BibRef
Liu, H.Z.[Hao-Zhe],
Zhuge, M.C.[Ming-Chen],
Li, B.[Bing],
Wang, Y.H.[Yu-Hui],
Faccio, F.[Francesco],
Ghanem, B.[Bernard],
Schmidhuber, J.[Jürgen],
Learning to Identify Critical States for Reinforcement Learning from
Videos,
ICCV23(1955-1965)
IEEE DOI Code:
WWW Link.
2401
BibRef
Nie, C.[Chang],
Wang, G.M.[Guang-Ming],
Liu, Z.[Zhe],
Cavalli, L.[Luca],
Pollefeys, M.[Marc],
Wang, H.S.[He-Sheng],
RLSAC: Reinforcement Learning enhanced Sample Consensus for
End-to-End Robust Estimation,
ICCV23(9857-9866)
IEEE DOI Code:
WWW Link.
2401
BibRef
Liu, S.[Siao],
Chen, Z.Y.[Zhao-Yu],
Liu, Y.[Yang],
Wang, Y.Z.[Yu-Zheng],
Yang, D.K.[Ding-Kang],
Zhao, Z.[Zhile],
Zhou, Z.Q.[Zi-Qing],
Yi, X.[Xie],
Li, W.[Wei],
Zhang, W.Q.[Wen-Qiang],
Gan, Z.X.[Zhong-Xue],
Improving Generalization in Visual Reinforcement Learning via
Conflict-aware Gradient Agreement Augmentation,
ICCV23(23379-23389)
IEEE DOI
2401
BibRef
Klinghoffer, T.[Tzofi],
Tiwary, K.[Kushagra],
Behari, N.[Nikhil],
Agrawalla, B.[Bhavya],
Raskar, R.[Ramesh],
DISeR: Designing Imaging Systems with Reinforcement Learning,
ICCV23(23575-23585)
IEEE DOI Code:
WWW Link.
2401
BibRef
Fang, F.[Fen],
Liang, W.Y.[Wen-Yu],
Wu, Y.[Yan],
Xu, Q.L.[Qian-Li],
Lim, J.H.[Joo-Hwee],
Improving Generalization of Reinforcement Learning Using a Bilinear
Policy Network,
ICIP22(991-995)
IEEE DOI
2211
Representation learning, Visualization, Reinforcement learning,
Object detection, Games, Feature extraction, Path planning, Generalization
BibRef
Lucchesi, N.[Nicoló],
Carta, A.[Antonio],
Lomonaco, V.[Vincenzo],
Bacciu, D.[Davide],
Avalanche RL: A Continual Reinforcement Learning Library,
CIAP22(I:524-535).
Springer DOI
2205
BibRef
Xie, Y.S.[Yuan-Sheng],
Vosoughi, S.[Soroush],
Hassanpour, S.[Saeed],
Towards Interpretable Deep Reinforcement Learning Models via Inverse
Reinforcement Learning,
ICPR22(5067-5074)
IEEE DOI
2212
Deep learning, Atmospheric modeling, Computational modeling,
Decision making, Reinforcement learning, Abstractive Summarization
BibRef
Wang, X.D.[Xu-Dong],
Lian, L.[Long],
Yu, S.X.[Stella X.],
Unsupervised Visual Attention and Invariance for Reinforcement
Learning,
CVPR21(6673-6683)
IEEE DOI
2111
Training, Visualization, Annotations,
Reinforcement learning, Manuals, Benchmark testing
BibRef
García-Ramírez, J.[Jesús],
Morales, E.[Eduardo],
Escalante, H.J.[Hugo Jair],
Multi-source Transfer Learning for Deep Reinforcement Learning,
MCPR21(131-140).
Springer DOI
2108
BibRef
Zhang, Z.Z.[Zi-Zhao],
Pfister, T.[Tomas],
Learning Fast Sample Re-weighting Without Reward Data,
ICCV21(705-714)
IEEE DOI
2203
Training, Costs, Limiting, Computational modeling,
Reinforcement learning, Noise robustness, Noise measurement,
Machine learning architectures and formulations
BibRef
Hong, J.[Jie],
Fang, P.F.[Peng-Fei],
Li, W.H.[Wei-Hao],
Zhang, T.[Tong],
Simon, C.[Christian],
Harandi, M.[Mehrtash],
Petersson, L.[Lars],
Reinforced Attention for Few-Shot Learning and Beyond,
CVPR21(913-923)
IEEE DOI
2111
Image recognition, Computational modeling,
Reinforcement learning, Prediction algorithms, Data models
BibRef
Zhang, Y.S.[You-Shan],
Ye, H.[Hui],
Davison, B.D.[Brian D.],
Adversarial Reinforcement Learning for Unsupervised Domain Adaptation,
WACV21(635-644)
IEEE DOI
2106
BibRef
Earlier: A1, A3, Only:
Adversarial Continuous Learning in Unsupervised Domain Adaptation,
DLPR20(672-687).
Springer DOI
2103
Adaptation models,
Computational modeling, Neural networks, Reinforcement learning,
Feature extraction.
BibRef
Lomonaco, V.,
Desai, K.,
Culurciello, E.,
Maltoni, D.,
Continual Reinforcement Learning in 3D Non-stationary Environments,
CLVision20(999-1008)
IEEE DOI
2008
Task analysis, Learning (artificial intelligence),
Benchmark testing, Color, Training, Complexity theory
BibRef
Zhu, L.C.[Lin-Chao],
Arik, S.Ö.[Sercan Ö.],
Yang, Y.[Yi],
Pfister, T.[Tomas],
Learning to Transfer Learn:
Reinforcement Learning-based Selection for Adaptive Transfer Learning,
ECCV20(XXVII:342-358).
Springer DOI
2011
BibRef
Manteghi, S.[Sajad],
Parvin, H.[Hamid],
Heidarzadegan, A.[Ali],
Nemati, Y.[Yasser],
Multitask Reinforcement Learning in Nondeterministic Environments:
Maze Problem Case,
MCPR15(64-73).
Springer DOI
1506
BibRef
Garcia, E.O.[Esteban O.],
de Cote, E.M.[Enrique Munoz],
Morales, E.F.[Eduardo F.],
Qualitative Transfer for Reinforcement Learning with Continuous State
and Action Spaces,
CIARP13(I:198-205).
Springer DOI
1311
BibRef
Chapter on Pattern Recognition, Clustering, Statistics, Grammars, Learning, Neural Nets, Genetic Algorithms continues in
Subspace Clustering, Subspace Learning .