术语 · 概念
品牌实体
品牌实体是指在机器的知识表示中,一个品牌被当作唯一可识别对象所对应的那条记录,而不只是一串出现在文本里的字符。
品牌实体是指在机器的知识表示中,一个品牌被当作唯一可识别对象所对应的那条记录,而不只是一串出现在文本里的字符。
搜索引擎和大模型处理”某某公司”时,需要先把这串字符对应到一个具体对象——这个过程叫实体链接(entity linking)。名字唯一时它是自动完成的;名字不唯一时,系统按语料中的证据强度选一个默认对象,这个选择结果决定了后续所有关于该名字的表述算在谁头上。
一个实体由什么构成
- 唯一标识:注册全称、统一社会信用代码、官网域名。
- 区分性属性:成立时间、注册地、业务范围、创始人。
- 关联关系:旗下产品、子域名、社交主页、被报道的链接。
这些属性的作用是提供区分特征。仅有”一家做 AI 的公司”这类描述无法完成消歧,因为它对同名的另一家同样成立。
让实体被正确建立的做法
在官网上设一个明确的实体页面,首屏用一句话写死唯一主体,并列出事实清单;用 Schema 结构化数据 的 Organization 类型把这些字段结构化,sameAs 列出所有属于同一主体的域名与主页;在描述中显式写出”不是哪些同名主体”。
否定式陈述在这里价值很高:模型需要的是区分特征,而”X 不是 Y”直接提供了这个特征,也让检索到该页面的回答有据可依。相关效果用同名混淆率衡量。
与知识图谱的关系
知识图谱是实体及其关系的集合。品牌实体建设本质上是在向各类知识图谱——搜索引擎的、模型训练语料的、第三方数据库的——提交一份自洽且可核验的记录。
- 同名混淆率 —— 同名混淆率是指在提到品牌名的 AI 回答中,指向的其实是另一家同名或近名主体的比例,是实体消歧效果的直接指标。
- 知识图谱 —— 知识图谱是用"实体—关系—实体"三元组来组织事实的结构化数据库,让机器可以沿着关系推理而不只是匹配字符串。
- Schema 结构化数据 —— Schema 结构化数据是按 Schema.org 词表把页面事实标注成机器可读格式(通常是 JSON-LD)的做法,让程序不必从正文里猜实体和关系。