Publications

2027 1 papers

2026 22 papers

arXiv preprint arXiv:2609.06107 First author Hugging Face Daily Papers #2

DataFlex-RL: An Evaluation Platform for RLVR Data Policies

Hao Liang, Mingrui Chen, Hengyi Feng, Meiyi Qiang, Wentao Zhang

An evaluation platform for reinforcement learning with verifiable rewards that compares rollout selection, reweighting, and domain-mixture policies under a common GRPO recipe.

Recommended citation: Hao Liang, Mingrui Chen, Hengyi Feng, Meiyi Qiang, Wentao Zhang. (2026). "DataFlex-RL: An Evaluation Platform for RLVR Data Policies." arXiv preprint arXiv:2609.06107.

arXiv preprint arXiv:2609.23088 First author Hugging Face Daily Papers #1

OmniEdu: Open Foundation Models for Learning and Teaching

Hao Liang, Qihan Lin, Meiyi Qiang, Linzhuang Sun, Hengyi Feng, Mingrui Chen, Sizhe Qiu, Wentao Zhang

An open family of 4B, 9B, and 27B foundation models for K–12 learning and teaching, trained with capability-balanced educational data for subject competence, curriculum grounding, learner diagnosis, and pedagogical support.

Recommended citation: Hao Liang, Qihan Lin, Meiyi Qiang, Linzhuang Sun, Hengyi Feng, Mingrui Chen, Sizhe Qiu, Wentao Zhang. (2026). "OmniEdu: Open Foundation Models for Learning and Teaching." arXiv preprint arXiv:2609.23088.

arXiv preprint arXiv:2609.20842 Co-first author

COAL-SQL: Coverage-Guided Augmentation and Failure-Driven Learning for Text-to-SQL Post-Training

Qifeng Cai*, Xuanguang Pan*, Hao Liang*, Chang Xu, Wentao Zhang

A unified Text-to-SQL post-training framework that combines coverage-guided augmentation with failure-driven learning, improving structural coverage and targeting model weaknesses exposed during GRPO.

Recommended citation: Qifeng Cai, Xuanguang Pan, Hao Liang, Chang Xu, Wentao Zhang. (2026). "COAL-SQL: Coverage-Guided Augmentation and Failure-Driven Learning for Text-to-SQL Post-Training." arXiv preprint arXiv:2609.20842.

Journal of Computer Science and Technology, 41(1): 289–317 First author Survey

Data Preparation for Large Language Models

Hao Liang, Zhen Hao Wong, Rui-Tong Liu, Yu-Han Wang, Meiyi Qiang, Zhengyang Zhao, Chengyu Shen, Conghui He, Wentao Zhang, Bin Cui

A systematic survey of data preparation across pre-training, continual pre-training, and post-training, connecting algorithms, workflows, datasets, and open research challenges.

KDD 2026 Co-first author Project leader

Let's Verify Math Questions Step by Step

Chengyu Shen*, Zhen Hao Wong*, Runming He*, Hao Liang*, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

A step-by-step verification framework for identifying flawed mathematical questions and reasoning traces before they are used for model training or evaluation.

ACM Multimedia 2026 Co-first author

Canvas-of-Thought: Grounding Mathematical Reasoning via Mutable Structured States

Linzhuang Sun*, Yuxia Zhu*, Ruitong Liu*, Hao Liang*, Sizhe Qiu*, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

Grounds mathematical reasoning in mutable structured states, enabling intermediate information to be explicitly organized, revised, rendered, and reused throughout the reasoning process.

ACM Multimedia 2026 Co-first author

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

Linzhuang Sun*, Ruitong Liu*, Yuxia Zhu*, Hao Liang*, Sizhe Qiu*, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Zhengzhou Zhu

Introduces a dynamic verifier that collaborates with the policy during multimodal reasoning, providing process-level guidance to detect errors and steer rollouts toward valid trajectories.

Technical report First author Hugging Face Daily Papers #1

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

Hao Liang, Qifeng Cai, Yilin Lin, J. Du, Q. Xia, S. Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, et al.

Benchmarks large language models as training-data preparators across core operations such as generation, cleaning, transformation, and quality control.

2025 8 papers

ICDE 2025 Co-first author Oral

PAS: Data-Efficient Plug-and-Play Prompt Augmentation System

Miao Zheng*, Hao Liang*, Fan Yang, Haoze Sun, Tianpeng Li, Lingchu Xiong, Yan Zhang, Youzhen Wu, Kun Li, Yanjun Shen, Mingan Lin, Tao Zhang, Guosheng Dong, Yujing Qiao, Kun Fang, Weipeng Chen, Bin Cui, Wentao Zhang, Zenan Zhou

A plug-and-play prompt augmentation system that improves downstream performance while requiring little task-specific training data.

2024 2 papers