About Me
I am a final-year Ph.D. student in Computer Science at the University of California, Los Angeles (UCLA),
advised by Prof. Wei Wang and collaborating closely with
Prof. Yizhou Sun.
My research focuses on agentic training and coding agents, spanning three complementary components: post-training agents for interactive tasks, building harnesses for long-horizon control, and verifying environments, rewards, and trajectories. I am also interested in LLM reasoning, including self-correction, tool use, and mathematical and scientific problem-solving.
I organize the UCLA Data Mining reading group. Before UCLA, I earned my B.S. in Computer Science from the
University of Illinois Urbana-Champaign in May 2022.
I am looking for full-time Research Scientist positions in agentic post-training and coding agents, starting in late 2026.
News
- Sep 2026 Released ACLArena, a study of agent continual learning across multi-stage post-training, together with code and a model collection.
- Jun 2026 HarnessBridge is accepted to EMNLP 2026 Findings.
- Jun 2026 Released HarnessBridge on learnable control for long-horizon coding agents.
- Mar 2026 Invited talk on ARLArena at NICE (Nexus for IntelligenCE).
Publications
(* denotes equal contribution)
Agentic RL & LLM Agents
-
Preprint 2026
ACLArena: Agent Continual Learning in Multi-stage Post-training
Haixin Wang*, Xiaoxuan Wang*, Junkai Zhang, Han Zhang, Renliang Sun, Alexander Taylor, Yidan Shi, Haoran Deng, Chenguang Wang, Jason Cong, Yizhou Sun, Wei Wang
[Paper]
[Code]
[Models]
-
ICML 2026
ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning
Xiaoxuan Wang*, Han Zhang*, Haixin Wang*, Yidan Shi†, Ruoyan Li†, Kaiqiao Han†, Chengyi Tong, Haoran Deng, Alex Taylor, Yanqiao Zhu, Renliang Sun, Jason Cong, Yizhou Sun, Wei Wang
[Paper]
[Code]
[Model]
-
Preprint 2026
When Vulnerability Is Not Exploitation: Reward Hacking in Coding Agents
Xiaoxuan Wang, Benson Chen, Felipe Peter, Nathan Palamuttam, Luke Johnston, Kacper Kramarz-Fernandez, Denis Moiseenko, Dmitry Vagner, Xiaojing Wang, Jakub Kubiak, Charan Reddy Kumar, Kevin Deng, Tom Macie, Palanieppan Muthaia, Wei Wang, Ning Cao, Jennifer Zhou
-
EMNLP Findings 2026
HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness
Xiaoxuan Wang*, Haixin Wang*, Alex Taylor, Jason Cong, Yizhou Sun, Wei Wang
[Paper]
[Code]
[Models]
LLM Reasoning, Post-Training & Evaluation
-
Preprint 2025
From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
Xiaoxuan Wang, Bo Liu, Song Jiang, Jingzhou Liu, Jingyuan Qi, Xia Chen, Baosheng He
[Paper]
-
NeurIPS MathAI 2025
EAST: Entropy-Based Adaptive Weighting for Self-Training
Xiaoxuan Wang, Yihe Deng, Mingyu Derek Ma, Wei Wang
[Paper]
[Code]
-
ICML 2024
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
Xiaoxuan Wang*, Ziniu Hu*, Pan Lu*, Yanqiao Zhu*, Jieyu Zhang, Satyen Subramaniam, Arjun R. Loomba, Shichang Zhang, Yizhou Sun, Wei Wang
Media coverage: Nature News Feature
[Paper]
[Code]
[Website]
-
KDD 2026
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
Junkai Zhang*, Jingru Gan*, Xiaoxuan Wang, Zian Jia, Changquan Gu, Jianpeng Chen, Yanqiao Zhu, Mingyu Derek Ma, Dawei Zhou, Ling Li, Wei Wang
[Paper]
[Code]
[Dataset]
Clinical & Domain Applications
-
Preprint 2024
CliBench: Multifaceted Evaluation of LLMs in Clinical Decision Making
Mingyu Derek Ma, Chenchen Ye, Yu Yan, Xiaoxuan Wang, Peipei Ping, Timothy S. Chang, Wei Wang
[Paper]
[Code]
[Website]
-
AAAI 2025
Memorize and Rank: Evaluating LLMs for Clinical Diagnosis Prediction
Mingyu Derek Ma, Xiaoxuan Wang, Yijia Xiao, Anthony Cuturrufo, Vijay S. Nori, Eran Halperin, Wei Wang
Also at NeurIPS GenAI4Health Workshop 2024
[Paper]
Earlier Work (NLP & Speech)
-
AAAI 2024
STAR: Boosting Low-Resource Event Extraction via Structure-to-Text Generation
Mingyu Derek Ma, Xiaoxuan Wang, Po-Nien Kung, P. Jeffrey Brantingham, Nanyun Peng, Wei Wang
[Paper]
-
EMNLP Findings 2023
Learning under Label Proportions for Text Classification
Jatin Chauhan, Xiaoxuan Wang, Wei Wang
[Paper]
-
Preprint 2022
Global Responses to the COVID-19 Pandemic: Evidence Finding and Verification
Rotem Dror, Xiaoxuan Wang, Dan Roth
-
Speech Communication 2022
Seamless Equal Accuracy Ratio for Inclusive CTC Speech Recognition
Heting Gao, Xiaoxuan Wang, Sunghun Kang, Rusty Mina, Dias Issa, John Harvill, Leda Sari, Mark Hasegawa-Johnson, Chang D. Yoo
[Paper]
Invited Talks
Internship Experience
Education
-
Ph.D. in Computer Science · Advisor: Wei Wang
-
B.S. in Computer Science, Grainger College of Engineering
Minor in Mathematics · James Scholar Honor · Dean's List
Teaching
-
Teaching Assistant
-
Course Assistant