Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited

发布时间:2026/10/5 6:45:51
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited 文章主要内容总结本文聚焦于评估大型语言模型(LLMs)对基本方向(cardinal directions, CDs)的推理能力,是对作者此前在COSIT-24会议上发表工作的扩展。研究使用一个包含5760个问题的基准数据集(由6个模板生成),测试了28个LLM(包括最新的大型推理模型LRMs)的表现。研究背景:空间推理是人类在物理世界中行动的基础,而LLMs不具备实体性,其对现实世界场景的空间推理能力有待验证。基本方向推理在导航、地理理解、气候分析等领域至关重要,因此成为研究焦点。实验设计:通过模板自动生成问题,变量包括移动方式(如步行、骑行)、人称(第一/二/三人称单复数)、方向类型(基本方向如南北、中间方向如东北)等。采用零样本提示,要求模型仅输出方向答案。主要结果:所有模型准确率均高于随机猜测(0.125),但无模型能完全可靠推理;最佳模型为o1(准确率0.92),远高于早期模型(如GPT-3.5 Turbo的0.60)。大型推理模型(LRMs)表现优于传统LLMs,且推理token使用量与难度相关(中间方向需更多token)。模型表现受人称、移动方式、模板类型影响(如线性物体模板T4准确率最低),存在性别偏向和方向混淆(中间方向更易出错)。关键发现:部分模型(如GPT-4.5)可能因训练数据包含基准集而表现异常;LRMs推理token使用量与答案正确性存在关联(部分模型

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询