Learning Interpretable Index Policies via LLM-Driven Zero-Order Optimization
[1] Yao Luan*, Ni Mu*, Qing-Shan Jia. (2026). "Learning Interpretable Index Policies via LLM-Driven Zero-Order Optimization." IEEE CASE 2026.
π A PDF version of my CV is available here.
[1] Yao Luan*, Ni Mu*, Qing-Shan Jia. (2026). "Learning Interpretable Index Policies via LLM-Driven Zero-Order Optimization." IEEE CASE 2026.
[2] Yao Luan*, Ni Mu*, Hanfei Ge, Yiqin Yang, Bo Xu, Qing-Shan Jia. (2026). "COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space." ICML 2026.
[3] Yiqin Yang*, Xu Yang*, Yuhua Jiang, Ni Mu, Hao Hu, Runpeng Xie, Ziyou Zhang, Siyuan Li, Yuan-Hua Ni, Qianchuan Zhao, Bo Xu. (2026). "GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent System." ICLR 2026.
[4] Xuantang Xiong*, Ni Mu*, Runpeng Xie, Senhao Yang, Yaqing Wang, Lexiang Wang, Yao Luan, Siyuan Li, Shuang Xu, Yiqin Yang, Bo Xu. (2026). "MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios." AAAI 2026.
[5] Ni Mu*, Yao Luan*, Qing-Shan Jia. (2026). "Covering the Pareto Frontier with LLM-Coordinated Interpretable Policy Library." 23rd IFAC World Congress (IFAC 2026).
[6] Ni Mu*, Yao Luan*, Qing-Shan Jia. (2025). "MAGPIE: Utilizing Agent-Specific Preferences for Multi-Agent Reinforcement Learning." 2025 China Automation Congress (CAC).
[7] Ni Mu, Zeyuan Liu, Yuhang Zhu, Qing-Shan Jia. (2025). "LLM-Empowered Knowledge Graph Construction for Optimization Formalization in Smart Manufacturing." 2025 China Automation Congress (CAC).
[8] Runpeng Xie*, Quanwei Wang*, Hao Hu, Zherui Zhou, Ni Mu, Xiyun Li, Yiqin Yang, Shuang Xu, Qianchuan Zhao, Bo Xu. (2025). "DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning." NeurIPS 2025.
[9] Yao Luan*, Ni Mu*, Yiqin Yang, Bo Xu, Qing-Shan Jia. (2025). "STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning." NeurIPS 2025.
[10] Pengbo Shen*, Yaqing Wang*, Ni Mu*, Yao Luan, Runpeng Xie, Senhao Yang, Lexiang Wang, Hao Hu, Shuang Xu, Yiqin Yang, Bo Xu. (2025). "SunTzu: A Long-Horizon Decision Making Benchmark for Large Language Models." Submitted to NeurIPS 2026.
[11] Yao Luan, Ni Mu, Qing-Shan Jia. (2025). "Addressing Coupling in Restless Multi-Armed Bandits by Finetuning Whittle Index." IEEE 21st International Conference on Automation Science and Engineering (CASE 2025).
[12] Ni Mu, Yao Luan, Qing-Shan Jia. (2025). "Safety-Guaranteed Policy Composition Via Generalized Policy Improvement for Autonomous Vehicles." IEEE 21st International Conference on Automation Science and Engineering (CASE 2025).
[13] Ni Mu*, Yao Luan*, Qing-Shan Jia. (2025). "Preference-based Multi-Objective Reinforcement Learning." IEEE Transactions on Automation Science and Engineering.
[14] Ni Mu*, Hao Hu*, Xiao Hu, Yiqin Yang, Bo Xu, Qing-Shan Jia. (2025). "CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries." ICML 2025.
[15] Ni Mu*, Yao Luan*, Yiqin Yang, Bo Xu, Qing-Shan Jia. (2025). "S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning." IJCAI 2025.
[16] Hanchen Zhou, Ni Mu, Qing-Shan Jia. (2025). "A Transformer-based Thermal Surrogate Model for Cooling Control in Data Centers." IEEE Robotics and Automation Letters.
[17] Ni Mu, Yao Luan, Qing-Shan Jia. (2024). "Preference-Based Multi-Objective Reinforcement Learning with Explicit Reward Modeling." 2024 China Automation Congress (CAC).
[18] Ni Mu, Xiao Hu, Qing-Shan Jia, Xun Zhu, Xiao He. (2024). "Large-scale data center cooling control via sample-efficient reinforcement learning." IEEE 20th International Conference on Automation Science and Engineering (CASE 2024).
[19] Ni Mu, Xiao Hu, Qing-Shan Jia. (2023). "Integrating mechanism and data: Reinforcement learning based on multi-fidelity model for data center cooling control." 2023 China Automation Congress (CAC).
[20] Can Chang, Ni Mu, Jiajun Wu, Ling Pan, Huazhe Xu. (2022). "E-MAPP: Efficient Multi-Agent Reinforcement Learning with Parallel Program Guidance." NeurIPS 2022.