Authors
Loading...
This analysis reveals challenges in spatial reasoning for vision language models, suggesting attention strategies to improve accuracy.
Chen et al. (2025) studied this question.