Ontology 1神经符号搜索:让多模态检索从关键词走向结构推理
今天(2026年8月3日)执行 AI 技术选题检索时,我使用了包含当天日期的多组关键词,包括“AI news August 3 2026 large language models”“artificial intelligence news today August 3 2026 machine learning”“大模型 最新进展 2026年8月3日 AI新闻”“OpenAI Anthropic Google AI August 3 2026”。通用搜索结果质量不稳定,Bing News RSS 返回了不可解析页面,因此进一步交叉查看了可机器读取的技术媒体和研究源 RSS。MarkTechPost 的 AI 新闻源在 2026年8月3日 00:49 UTC 更新,首条新闻聚焦 Onton 发布的 Ontology 1:一个面向复杂、会话式、多模态商品搜索的神经符号搜索模型。该报道披露,Ontology 1 在 90 个查询组成的基准上,由 3 个独立 LLM 评委评分,mean precision@10 达到 0.630,对比 Google Shopping 的 0.543、Amazon 的 0.469,同时索引规模约为 Amazon 的 1%。
这条新闻值得关注,不只是因为“电商搜索更准”这个表层结论,而是因为它把一个长期问题推到了台前:当用户的需求变成“找一件适合小户型、可放在浅色木地板旁、孩子不容易撞伤、还能收纳玩具的边柜”时,传统关键词检索、向量相似度检索和纯大模型问答都各有短板。神经符号搜索试图把神经网络的语义理解、多模态表示能力,与符号系统的属性约束、关系推理和可解释匹配结合起来。这对 PDF 文档处理、企业知识库、RAG 检索增强和复杂文档结构化同样有直接启发。
为什么搜索正在从“召回文本”走向“理解意图”
过去二十多年,搜索系统的核心工作是把用户查询映射到可索引字段:关键词、标题、类目、标签、链接权重、点击反馈。后来向量检索加入进来,系统可以识别“语义相似”而不只依赖字面匹配。例如用户搜索“适合露营的轻便锅具”,向量模型能够把“便携”“户外”“钛合金”“折叠手柄”等结果召回出来。
但复杂搜索并不只是语义相似。它通常同时包含硬约束、软偏好、隐含关系和视觉判断。以商品搜索为例,“适合儿童房”的意思可能包含圆角、材质安全、颜色柔和、尺寸不高;“适合租房”可能意味着轻便、免打孔、可拆卸、价格低;“和这张图片风格类似”又需要图像语义与文本属性共同判断。单纯向量检索容易召回“看起来相关”的结果,却不一定满足所有约束。单纯规则系统能过滤明确属性,却难以理解自然语言中的模糊偏好。
Ontology 1 代表的方向,是把搜索任务拆成更结构化的推理过程:先理解用户意图,再识别实体、属性、关系、场景和约束,然后在多模态索引中做匹配与排序。这里的“神经符号”并不是回到传统专家系统,而是在大模型和多模态模型之上增加可约束、可组合、可解释的结构层。
Ontology 1披露数据说明了什么
从 MarkTechPost 披露的信息看,Ontology 1 的结果最值得讨论的是 precision@10。这个指标衡量前 10 个结果中有多少是相关结果,比“有没有找到一个好结果”更贴近真实用户体验。用户通常不会翻很多页,前 10 条结果的质量直接决定搜索是否可用。
| 系统 | mean precision@10 | 相对 Ontology 1 差距 | 可能优势 | 可能短板 |
|---|---|---|---|---|
| Ontology 1 | 0.630 | - | 神经语义理解、符号约束、多模态商品匹配 | 新系统规模和场景仍需更多公开验证 |
| Google Shopping | 0.543 | 约低 13.8% | 大规模商品索引、成熟排序、生态数据 | 对复杂会话式需求的结构推理可能不足 |
| Amazon | 0.469 | 约低 25.6% | 交易数据、评价数据、库存和转化反馈 | 搜索常受关键词、广告和类目排序影响 |
需要谨慎的是,这组数据来自报道摘要,基准规模为 90 个查询,评估方式是 3 个独立 LLM 评委。它足以说明一个技术趋势,但还不能等同于全面、长期、跨场景的搜索质量结论。对工程团队真正有价值的不是照搬数字,而是理解其背后的架构信号:搜索质量正在从“更大的索引”和“更强的 embedding”进一步走向“可推理的领域结构”。
神经符号搜索的技术分层
一个可落地的神经符号搜索系统,通常可以拆成四层。
第一层是多模态表示。系统需要把文本、图片、表格、类目、属性和用户行为转换成可检索表示。对于电商,这是商品标题、描述、图片、规格、评价和场景图;对于文档处理,则是 PDF 文本块、页面截图、表格区域、标题层级、页眉页脚、字体样式和坐标信息。
第二层是意图解析。模型要从自然语言中抽取用户真正想要的目标,而不是只做关键词分词。比如“找出这份合同里所有和付款延期有关的条款”,其中实体是合同条款,主题是付款延期,约束可能包含违约、宽限期、利息、通知义务等同义表达。
第三层是符号约束。系统需要把模型理解到的意图变成可执行条件:字段过滤、范围比较、关系匹配、层级约束、跨页引用、相邻节点关系等。这一层让搜索不只是“相似”,而是“满足条件”。
第四层是排序与解释。最终结果需要根据相关性、约束满足程度、证据强度和业务权重排序,并能解释为什么命中。对企业应用来说,可解释性不是锦上添花,而是降低误召回和误用风险的基础能力。
它与RAG有什么关系
RAG 的经典流程是“用户问题 -> 检索相关片段 -> 交给大模型生成答案”。这个流程在简单问答里很好用,但在复杂文档和业务场景中容易遇到三类问题:检索片段不完整、片段之间关系丢失、模型生成时无法判断证据是否足够。
神经符号搜索可以看作 RAG 的前置升级。它不是把文档切成若干 chunk 后直接向量检索,而是先建立文档对象之间的结构:章节、段落、表格、图片、脚注、引用、编号、页面坐标、字段类型和语义标签。检索时,系统不只召回文本片段,还可以召回“满足某个结构条件的证据集合”。
例如,用户问“这份招标文件中技术评分和商务评分各占多少”,普通向量检索可能召回多个包含“评分”的段落,但不一定抓到完整表格。神经符号检索会倾向于先识别“评分表”这个结构,再在表格单元格中定位“技术评分”“商务评分”和对应权重。这样进入大模型的上下文更完整,回答也更容易被校验。
对我们PDF文档处理的意义/启示
1. PDF转Word不能只依赖文本相似度
PDF 文档处理的核心难点不是“把文字拿出来”,而是把视觉版面、阅读顺序和语义结构一起还原。纯 OCR 或纯文本抽取会丢失很多结构信息:表格边界、跨页表头、脚注归属、图片说明、双栏顺序、标题层级、页眉页脚和印章位置。Ontology 1 这类神经符号搜索的思路提醒我们,文档转换也需要把神经模型的感知能力与符号化文档结构结合起来。
在 PDF 转 Word 场景中,可以把每一页解析为结构化对象:文本块、表格、图片、标题、列表、注释、坐标框、字体属性、OCR 置信度和来源证据。大模型负责理解复杂页面和语义关系,规则系统负责约束坐标、顺序、样式和 docx 输出。这样比让模型直接“生成 Word 内容”更可控。
2. 建立文档本体比堆叠Prompt更重要
“Ontology”这个词对文档智能尤其关键。我们也需要自己的文档本体:什么是标题、正文、表格、表头、合并单元格、图片、图注、页码、页眉、脚注、合同条款、签署区、发票字段、目录项。只有这些对象被显式建模,系统才能稳定处理查询、转换和质量评估。
如果没有文档本体,Prompt 再复杂也只是让模型在自由文本中猜测;有了文档本体,模型输出就可以被 JSON Schema 校验,被渲染器消费,被评估器复查,被局部重跑机制修复。
3. 检索增强应从chunk升级到结构证据
我们的 PDF 文档处理如果要接入问答、摘要或审阅能力,不应只做固定长度 chunk 切分。更合理的做法是把 chunk 与结构对象绑定:段落属于哪个标题,表格跨了几页,图片对应哪个图注,脚注引用来自哪里,条款编号上下级关系是什么。检索时优先返回结构证据,而不是孤立文本片段。
这会直接提升 RAG 的可靠性。对用户来说,答案不是“模型看起来说得对”,而是能追溯到具体页码、区域、表格行列和原文证据。
4. 质量评估要覆盖结构而不只是文本
PDF 转 Word 的质量评估常常停留在字符覆盖率,但真正影响用户体验的是结构还原。神经符号思路下,评估指标可以升级为:标题层级一致性、阅读顺序正确率、表格行列匹配率、图片保留率、页眉页脚过滤准确率、跨页表格延续识别率、OCR 低置信区域占比、生成 docx 后的可编辑性。
当系统发现某一页表格结构不可信,可以只重跑表格识别;发现某个区域 OCR 置信度低,可以只重跑该区域;发现标题层级异常,可以让模型基于上下文重新分类。局部修复比整篇重转更省成本,也更容易定位问题。
工程落地路线
短期可以从“结构化中间表示”开始,把 PDF 解析、OCR、版面分析和 docx 渲染之间的数据协议统一起来。每个对象都带上类型、坐标、文本、样式、来源、置信度和页面编号。
中期可以引入神经符号检索能力,把用户问题、转换错误和质量评估都映射到文档对象层。例如“第 4 页表格错乱”不再只是用户反馈文本,而是定位到页面、表格、行列、坐标和渲染结果之间的差异。
长期来看,PDF 转 Word 会从文件格式转换升级为文档智能系统。它不仅输出 docx,还能解释每个结构来自哪里,哪些区域不确定,哪些地方经过了模型修复,哪些证据支持最终结果。Ontology 1 展示的不是一个电商搜索小改进,而是一个更大的方向:AI 系统要处理复杂现实任务,必须同时拥有语义理解、结构约束和可验证证据链。
结语
2026 年 8 月 3 日这条神经符号搜索新闻提醒我们,下一阶段 AI 应用竞争不只在模型参数和上下文长度,也在“能否把非结构化世界转成可推理结构”。对于 PDF 文档处理来说,这正是最核心的问题:PDF 看起来是页面,实际上隐藏着文本、坐标、视觉层级和业务语义。谁能把这些元素组织成可检索、可约束、可验证的文档本体,谁就能把 PDF 转 Word 从一次性转换服务推进到可信的文档智能基础设施。