Hello, I’m

Zhihao Zhu / 朱志浩

Master’s Student at Fudan University

I am a master’s student at Fudan University working on efficient generative models for autonomous driving. My research focuses on transforming autoregressive Vision-Language-Action models into efficient parallel generative systems through discrete diffusion, flow matching, and hierarchical distillation. My recent work explores how to preserve multimodal reasoning while reducing the latency and exposure bias of sequential action generation.

  • Efficient VLA
  • Autonomous Driving
  • Diffusion & Distillation
Portrait of Zhihao Zhu

Recent Updates

News

  1. WAM-Diff2 was released as a preprint.
  2. WAM-Flow was accepted to CVPR 2026.
  3. WAM-Diff and WAM-Flow were released as preprints.

Selected Publications

Research at the intersection of generation and action

Selected work on efficient, parallel generative models for autonomous driving. * Equal contribution. † Corresponding author.

CVPR 2026

WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving

Yifang Xu*, Jiahao Cui*, Feipeng Cai*, Zhihao Zhu*, Hanlin Shang, Shan Luan, Mingwang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

A discrete flow-matching VLA that replaces sequential trajectory decoding with parallel, bidirectional coarse-to-fine refinement and simulator-guided alignment.

arXiv 2025

WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving

Mingwang Xu*, Jiahao Cui*, Feipeng Cai*, Hanlin Shang*, Zhihao Zhu, Shan Luan, Yifang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

A masked diffusion VLA for flexible non-causal trajectory decoding, combining sparse MoE scaling with online reinforcement learning for closed-loop planning.

Research

Three connected research directions

Efficient Generative VLA Models

Parallel discrete generation and efficient decoding for Vision-Language-Action models in autonomous driving.

AR-to-Diffusion Knowledge Transfer

Progressive adaptation and hierarchical distillation that transfer capabilities from autoregressive models to diffusion systems.

Reliable Planning and Multimodal Reasoning

Preserving scene understanding and multimodal reasoning while improving the efficiency and robustness of trajectory generation.

Experience & Education

Academic background

Fudan University

Master’s Student

Shanghai, China

Research on efficient multimodal generative models, Vision-Language-Action models, and autonomous driving.

South China University of Technology

Information Management and Information Systems, School of Mathematics

Guangzhou, China

Undergraduate study in information management and information systems.

Contact

Let’s discuss research

I am open to research discussions and collaborations on efficient multimodal generative models and autonomous driving.