PPRBench: A Process-level Benchmark for LLMs’ Physical Reasoning
Published in under review, 2026
We introduce PPRBench, a contamination-free benchmark for evaluating physical reasoning in large language models at the process level, along with PhysGrader, a rubric-guided LLM-as-a-judge framework for step-by-step evaluation. We also explore GRPO with process rewards generated by PhysGrader, and evaluate 16 frontier LLMs.
Recommended citation: Denghong Luan, Wentao Shi, Wenjie Wang, Xiangnan He. "PPRBench: A Process-level Benchmark for LLMs' Physical Reasoning." under review.
