AI 读图纸为什么总是偏科:文字看得懂,计数和空间关系却不可靠
AI 读工程图纸,已经进入了一个容易被误判的阶段。
它能很快读出标题栏、房间名称、构件编号和尺寸文字,回答也像一个熟悉图纸的人。可一旦问题变成“门窗到底有多少”“这根梁连接了哪些柱”“这个详图索引指向哪里”,可靠性就会明显下降。
这不是简单的“模型还不够聪明”。工程图纸理解本来就由多种不同能力组成:文字提取、文字与对象绑定、符号识别、完整计数、几何计算、空间拓扑、跨图引用,以及最后的工程验证。它们没有同步成熟。
更准确的判断是:当前多模态模型已经是不错的图纸文档助手,但还不是可靠的图纸推理器。
这条边界,直接影响企业怎么选工具、怎么设计试点,也决定哪些工作可以先交给 AI,哪些工作必须配解析器、计算工具和人工复核。
一次看起来不错的测试,为什么仍然不能放手
7 月 16 日,我们用同一张自制样张测试了日常订阅的 ChatGPT 和 Gemini。两款产品都能较完整地读出标题栏、轴网、构件编号、尺寸和数量,人工评分分别为 7/10 和 8/10。
如果只看总分,这已经相当可用。
但按照我们事先设置的测试红线,两者都不能直接进入无人复核流程:一个把并不相邻的房间说成相邻,另一个把图中没有直接标明的空间解释成“公共区”,并继续推导采光、荷载和施工影响。
基础字段读得准,空间关系仍会越界。这个结果不是为了说明哪款模型更强。样张简单、每款产品只测试一次,而且没有记录底层模型的准确版本,不能把它包装成模型排行榜。
它真正暴露的是一种能力结构:图纸上的文字越清楚,任务越接近普通文档提取,模型表现通常越好;任务越依赖符号遍历、精确位置、对象连接和跨页状态,错误越难靠语言流畅度发现。
研究基准也观察到了相似的坡度。
“看懂图纸”不是一个能力,而是一条坡
2026 年 1 月发布的 AECV-Bench(arXiv:2601.04819)预印本,专门评测多模态模型对建筑与工程图纸的理解。它包含 120 张平面图的对象计数,以及覆盖文字提取、实例计数、空间推理和比较推理的 192 组图纸问答。
论文报告的结果很有代表性:文字和 OCR 类问答最高可到 0.95 准确率;空间推理处于中间;门窗等符号的可靠计数仍不稳定,常见准确率在 0.40—0.55。这里的数字来自该论文的统一实验,不代表所有图纸、所有模型版本或企业自己的输入链路,但它说明用一个总分描述“图纸理解能力”会掩盖问题。
更适合工程场景的划分是:

越往下,任务越不能只靠一张图和一次自然语言回答完成。
标题栏里的“图号”“比例”“日期”通常有明确文字区域。门的数量却要求模型先识别不同画法的门,再遍历整张图,区分单扇、双扇、滑门和图例,避免漏计、重计。空间关系还要进一步判断对象是否相邻、连接、包含或仅仅在二维投影上接近。
这些任务对人来说都叫“看图”。对系统来说,它们需要的计算过程完全不同。

为什么文字容易,计数仍然会错
文字提取有一个天然优势:答案通常就在局部区域里。
模型看到标题栏,识别出“结构平面图”“1:100”“A 版”,就能形成结果。即使上下文不完整,局部文字也常常足以回答问题。
计数不是局部任务。
要回答“有多少樘门”,系统必须完整扫描图面,并在同一套规则下处理所有候选对象。任何一次漏看、重复、分类错误,都会改变最终数字。图纸密度增加后,小符号、重叠线、引出线、旋转文字和相似图例还会互相干扰。
这也是为什么一个模型可能正确列出多个门窗编号,却给出错误总数。它表现出了识别能力,却没有完成可靠的全图遍历。
在工程工作流里,只有总数还不够。系统还应保留对象清单,让复核者知道“12 樘门”具体对应哪 12 个位置。没有对象级证据的精确数字,看起来省事,实际上最难检查。
在工程系统里,可以把门窗、构件和设备计数拆成两步:先由视觉检测或 CAD 解析器形成候选对象,再让模型结合图例和上下文完成分类、解释与异常提示。这是我们的设计建议,不代表所有图纸都适用;最终数字仍要能够回到对象清单逐项复核。
给了坐标,也不等于模型会算几何
一个常见设想是:既然从图片读图不稳定,把 DWG 转成 JSON,把坐标直接交给大模型,问题就解决了。
结构化输入确实有价值。它可以减少小字、分辨率、线型和视觉缩放造成的部分损失,也能让图层、块、文字、尺寸和坐标成为可查询字段。
但它解决的是“模型能否拿到信息”,没有自动解决“模型能否稳定计算”。
FloorplanQA(arXiv:2507.07644)的主实验用 JSON 提供室内对象的坐标和尺寸,并在部分 HSSD 布局上用等价 XML 做格式消融,测试距离、视角、放置、可见性、自由空间和最短路径等任务。模型面对的不是模糊图片,而是已经结构化的几何数据。
论文仍观察到明显的任务坡度。在轴对齐的合成布局上,一些距离和视角任务平均准确率可达 75%—95%;换成包含复杂多边形的 HSSD 布局后,相关准确率降到 35%—60%;需要几何并集、搜索或多步避障的优化与规划任务,平均准确率只有 5%—45%。
论文还报告,在一个成对距离任务上,为 GPT-4.1 接入 Python 解释器后,准确率从 56% 提高到 99%。这些结果进一步说明,给模型坐标和让系统可靠完成几何运算,是两件事。
这些数字同样只适用于该预印本的任务、容差和模型设置。它们更重要的启示不是“哪个模型得分高”,而是:坐标是一种输入,几何运算是一种能力,两者不能混为一谈。
距离、相交、包含、碰撞、连通和最短路径,本来就有成熟的确定性算法。让大模型直接在长文本坐标中反复心算,既浪费能力,也难以验证。
更合理的分工是:模型负责理解问题、选择工具、组织步骤和解释结果;几何引擎负责计算;系统保留输入参数、执行过程和返回结果,交给人复核。
单页问答,离真实工程任务还有多远
真实项目很少只问一张图。
工程师要在总说明、平面图、剖面图、节点详图、材料表、规范和计算书之间来回核对。一个详图索引要找到目标图纸,一个构件编号要关联设计说明,一处变更还可能影响多个专业。
2026 年 3 月发布的 AEC-Bench(arXiv:2603.29199)预印本,把任务分成单页图纸内部、同一套图纸内跨页,以及图纸、规范和送审资料之间三个层级。其公开版本包含 9 类任务、196 个实例,覆盖详图技术审查、标题与引注核验、跨图引用解析与追踪、图纸目录一致性、规范—图纸同步以及送审资料复核等场景。
这个基准评测的是能够浏览文件、调用工具并产生结果的智能体系统,不是聊天窗口里单独的一次识图。它提示企业,随着任务从“这张图写了什么”升级为“这一套资料是否互相一致”,系统还需要文件检索、页码定位、跨图状态、完整遍历和结果留痕。
到了结构计算等高风险任务,最终文字甚至不该成为主要验收对象。
7 月 16 日发布的 StructureClaw(arXiv:2607.14896)预印本提出了一个更严格的评测方式:一个场景只有在所需产物和执行断言全部通过时才算成功。它构造了 150 个受控场景;在其中 50 个标准案例上,10 种智能体—模型配置的平均成功率,从通用技能模式的 56.8% 提高到完整工作流配置的 88.6%。
这不证明某套系统已经适合直接承担工程责任。论文也指出,无效数值输入的安全处理、多模态结构模型重建等问题仍是瓶颈。这里比较的是整套工作流配置,技能路径、先验、产物要求和校验指导同时发生了变化,而且每个场景只运行一次,不能把 31.8 个百分点归因于某一个组件。
它说明的是另一件事:把要求、模型、计算、校核和报告做成可执行产物,比只检查最终回答是否流畅,更容易暴露真实失败。
企业验收时,不要从“自动审图”开始
如果一开始就让 AI “找出整套图纸的所有问题”,很难知道它漏了什么,也无法区分错误来自输入、识别、检索、计算还是专业判断。
更稳的试点顺序,应沿着能力坡度逐级推进。
第一级:文字和图纸身份
先验收图名、图号、版本、日期、比例、专业和修订记录。每个字段要有页码或区域证据,看不清时允许返回“无法确认”。
第二级:对象和文字绑定
再测试轴网、构件、门窗、设备、尺寸和材料标注。不能只列名称,还要说明它位于哪一页、哪个轴网或哪个局部区域。
第三级:计数和关系
计数必须同时输出对象清单;空间问题要逐项给出起点、终点和关系证据。把“相邻”“连接”“包含”“对齐”分别测试,不要混成一句宽泛提问。
第四级:跨图和跨文档
测试详图索引、目录与标题栏、图纸与说明、图纸与计算书之间的对应关系。此时要记录检索范围,避免系统只查到部分文件却给出全局结论。
第五级:工具执行和人工复核
涉及精确几何、数量计算、规范校验和结构分析时,要求系统调用相应工具,保留输入、版本、执行日志和异常状态。AI 的工程结论只能作为待复核项,不能因为表达完整就自动进入签批。

每一级都应设置失败红线:读错版本、编造对象、把空间关系说反、给出无法回溯的精确数量,或者在证据不足时判断“安全”“合规”,都应直接拦截,而不是用其他题目的高分抵消。
采购的对象,应当是系统而不是模型名称
同一个基础模型,接入不同的图纸解析器、几何工具、文档检索和证据记录后,工程表现可能完全不同。反过来,再强的模型,如果只接收一张被压缩的整页截图,也会在小字、符号遍历和精确定位上丢失信息。
所以,企业采购或自建图纸 AI 时,至少要问清楚:
- 系统实际接收的是截图、PDF,还是保留图层和对象的结构化数据?
- 每个数量和关系能否回到具体对象、坐标或图纸区域?
- 精确几何与专业计算由什么工具完成?
- 系统如何记录缺失输入、不确定项和工具失败?
- 模型、解析器、规则和数据版本变化后,是否重新跑过本单位测试集?
- 哪些结论必须由专业人员确认,系统能否阻止未经复核的结果继续流转?
如果这些问题没有答案,换一个更大的模型,通常只能让回答更像结论,不能让结论更可验证。
先从可核验的小任务开始
企业不必等到 AI 能独立审完整套图纸才开始试点。可以先让它整理图纸身份、提取对象清单、关联索引和生成待复核问题。但每向下走一级,都要补上对应的工具、证据和人工责任。
验收的目标也应随之改变:不问模型“看懂了吗”,而要检查它看到了什么、怎么算的、漏了什么,以及人能不能回到原图确认。
参考资料
- Kondratenko, Aleksei, et al. AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding, arXiv:2601.04819,2026。
- Rodionov, Fedor, et al. FloorplanQA: A Benchmark for Spatial Reasoning in LLMs using Structured Representations, ICML 2026(arXiv:2507.07644v4,首次提交于 2025 年)。
- Mankodiya, Harsh, et al. AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction, arXiv:2603.29199,2026。
- Qin, Sizhong, et al. StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows, arXiv:2607.14896,2026。
如果你的团队也在评估 AI 图纸理解
可以通过文末入口或平台私信,简单说明图纸专业、输入格式,以及希望 AI 完成的具体任务。我们会先判断它更接近文字提取、对象识别、空间计算还是跨文档复核,再讨论是否适合做小范围验证。
关注我们
欢迎搜索并关注 筑见实验室,获取更多建筑 AI、结构计算与工程数字化实践:
