术语 · 方法
Schema 结构化数据
Schema 结构化数据是按 Schema.org 词表把页面事实标注成机器可读格式(通常是 JSON-LD)的做法,让程序不必从正文里猜实体和关系。
Schema 结构化数据是按 Schema.org 词表把页面事实标注成机器可读格式(通常是 JSON-LD)的做法,让程序不必从正文里猜实体和关系。
同一份信息在页面上有两种存在形式:给人看的正文,和嵌在 <script type="application/ld+json"> 里给机器看的字段。后者消除了解析歧义——“上海”是地址还是文章主题,正文里要靠语境判断,字段里 addressLocality: "上海" 没有第二种读法。
与实体识别相关的常用类型
- Organization:主体本身。
legalName、foundingDate、taxID、address这几个字段是品牌实体唯一性的关键,sameAs把多个域名和外部主页绑成同一个实体。 - FAQPage:问答对。适合承载消歧类问题。
- DefinedTerm:术语定义。
alternateName可以登记别名,让不同叫法指向同一个概念。 - BreadcrumbList:层级位置。
- Article / WebPage:内容与发布者归属。
常见失效原因
结构化数据最常见的问题不是没写,而是写了但整块失效:
- 引号未转义。答案文本里出现英文双引号直接破坏 JSON 结构,整个 JSON-LD 块被丢弃,而页面看上去完全正常。
- 多块冲突。同一实体在不同脚本块里给出不同的名称或地址。
- 与正文不符。标注里写的事实页面上找不到。
根治办法是不手写 JSON——用程序把数据序列化成 JSON-LD,转义交给序列化器处理;同一实体在全站只声明一次,其他地方用 @id 引用。
与 llms.txt 的分工
Schema 面向抓取网页的爬虫,llms.txt 面向直接读文本的模型客户端。两者不互相替代,前者标注结构,后者提供导航。