Welcome! I am Hui Yuan [xweɪ ɥæn], and my name in Chinese is 袁慧. I am a Research Scientist at Utopai Studios, where I work on long-horizon agents for interactive video creation. Previously, I was a Research Scientist at Meta.

My research spans reinforcement learning, long-horizon agents, and generative-model post-training. Application-wise, I am particularly interested in developing creative intelligence through agentic media generation systems.

I received my Ph.D. in Electrical and Computer Engineering from Princeton University, advised by Mengdi Wang, and my B.S. in Statistics from the University of Science and Technology of China.

I have also been fortunate to work with Yinyu Ye, Csaba Szepesvári, and Yingyu Liang.

Research

Selected Publications

LC-GRPO training and evaluation results
In submission to ICLR 2027

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction

Yingqing Guo, Hui Yuan, Zijian He, Mengdi Wang, Zheng Ding

FMIP joint continuous-integer modeling overview
ICLR 2026

FMIP: Joint Continuous-Integer Flow for Mixed-Integer Linear Programming

Hongpei Li, Hui Yuan, Han Zhang, Jianghao Lin, Dongdong Ge, Mengdi Wang, Yinyu Ye

MATH-Perturb benchmark overview
ICML 2025

MATH-Perturb: Benchmarking LLMs’ Math Reasoning Abilities against Hard Perturbations

Kaixuan Huang, Jiacheng Guo, Zihao Li, Xiang Ji, Jiawei Ge, Wenzhe Li, Yingqing Guo, Tianle Cai, Hui Yuan, Runzhe Wang, Yue Wu, Ming Yin, Shange Tang, Yangsibo Huang, Chi Jin, Xinyun Chen, Chiyuan Zhang, Mengdi Wang

Gradient-entanglement training dynamics
ICLR 2025

A Common Pitfall of Margin-Based Language Model Alignment: Gradient Entanglement

Hui Yuan*, Yifan Zeng*, Yue Wu*, Huazheng Wang, Mengdi Wang, Leqi Liu* (* leading contributors)

TreeG tree-search guidance overview
NeurIPS 2025

Training-Free Guidance Beyond Differentiability: Scalable Path Steering with Tree Search in Diffusion and Flow Models

Yingqing Guo*, Yukang Yang*, Hui Yuan*, Mengdi Wang (* equal contribution)

MaxMin-RLHF framework and results
ICML 2024

MaxMin-RLHF: Towards Equitable Alignment of Large Language Models with Diverse Human Preferences

Souradip Chakraborty, Jiahao Qiu, Hui Yuan, Alec Koppel, Dinesh Manocha, Furong Huang, Amrit Bedi, Mengdi Wang

Gradient guidance for diffusion models overview
NeurIPS 2024

Gradient Guidance for Diffusion Models: An Optimization Perspective

Yingqing Guo*, Hui Yuan*, Yukang Yang, Minshuo Chen, Mengdi Wang (* equal contribution)

Reward-directed conditional diffusion overview
NeurIPS 2023

Reward-Directed Conditional Diffusion: Provable Distribution Estimation and Reward Improvement

Hui Yuan, Kaixuan Huang, Chengzhuo Ni, Minshuo Chen, Mengdi Wang

Additional Publications

  1. A First-Order Generative Bilevel Optimization Framework for Diffusion Models. Q Xiao, Hui Yuan, A F M Saif, G Liu, R R Kompella, M Wang, T Chen. ICML 2025. Paper Code
  2. Conversational Dueling Bandits in Generalized Linear Models. S Yang, Hui Yuan, X Zhang, M Wang, H Zhang, H Wang. KDD 2024. Paper Code
  3. Tree Search-Based Evolutionary Bandits for Protein Sequence Optimization. J Qiu*, Hui Yuan*, J Zhang*, W Chen, H Wang, M Wang. AAAI 2024. Paper
  4. Unified Off-Policy Learning to Rank: A Reinforcement Learning Perspective. Zeyu Zhang, Yi Su, Hui Yuan, Yiran Wu, Rishab Balasubramanian, Qingyun Wu, Huazheng Wang, Mengdi Wang. NeurIPS 2023. Paper Code
  5. Bandit Theory and Thompson Sampling-Guided Directed Evolution for Sequence Optimization. Hui Yuan, Huazheng Wang, Chengzhuo Ni, Xuezhou Zhang, Le Cong, Csaba Szepesvári, Mengdi Wang. NeurIPS 2022. Paper
  6. Learning Entangled Single-Sample Gaussians in the Subset-of-Signals Model. Yingyu Liang, Hui Yuan. COLT 2020. Paper
  7. Learning Entangled Single-Sample Distributions via Iterative Trimming. Hui Yuan, Yingyu Liang. AISTATS 2020. Paper
  8. Uniform Joint Screening for Ultra-High Dimensional Graphical Models. Z Zheng, H Shi, Y Li, Hui Yuan. Journal of Multivariate Analysis. Paper