Preprint2026
SokoBench: Evaluating long-horizon planning and reasoning in large language models
Unknown
This paper introduces SokoBench, a simplified Sokoban-based benchmark to evaluate long-horizon planning and reasoning in large reasoning models.
0Jan 1, 2026Large Language ModelsReasoning
arXiv