GEO证据包颗粒度适配率的直接答案是:先把AI答案或内容资产里的每条关键主张拆成主张类型,再判断对应证据包的粒度是否足以支撑该主张。标准口径为“颗粒度与主张类型匹配的证据包数量 / 已建立证据包数量”。若用百分比展示,再乘以100%。这个指标不看证据多不多,而看证据是否刚好落在AI可复核、可抽取、可引用的层级。
直接回答:GEO证据包颗粒度适配率是什么?
GEO证据包颗粒度适配率是主张级指标,基础公式为匹配证据包数÷已建立证据包数,建议以80分作为单包匹配线。
证据包是围绕一条主张建立的一组可复核材料,通常包含主张原句、来源地址、证据片段、版本时间、适用边界、实体名称和复核结论。颗粒度适配率关注的是“证据包的切分层级是否适合主张类型”。一个页面能说明品牌定位,却未必能证明某个表格数值;一个FAQ能回答常见问题,却未必能支撑长篇趋势判断;一个视频链接能说明有素材,却未必能让AI定位到第几秒的关键信息。
标准公式可以写成:
GEO证据包颗粒度适配率 = 颗粒度与主张类型匹配的证据包数量 / 已建立证据包数量
百分比口径 = 颗粒度与主张类型匹配的证据包数量 / 已建立证据包数量 × 100%
单个证据包的颗粒度评分建议采用100分制。若页面、段落、表格行、FAQ、文件片段、媒体时间点、结构化字段这7类证据中,实际证据粒度能覆盖主张主体、谓词、条件、时间和边界,且没有明显过粗或过碎,单包评分达到80分及以上,就计入“匹配证据包数量”。低于80分则进入待修订池。
| 指标名 | English | 计算公式 | 数据来源 |
|---|---|---|---|
| 证据包颗粒度适配率 | Evidence Package Granularity Fit Rate | 匹配证据包数量 / 已建立证据包数量 × 100% | 主张清单、证据包台账、复核记录 |
| 单包颗粒度评分 | Package Granularity Score | 粒度命中分 + 定位分 + 边界分 + 可复核分 | 证据片段、URL、文件定位器、时间点 |
| 过粗证据占比 | Over-broad Evidence Ratio | 过粗证据包数量 / 已建立证据包数量 × 100% | 页面级证据、弱定位来源 |
| 过碎证据占比 | Over-fragmented Evidence Ratio | 过碎证据包数量 / 已建立证据包数量 × 100% | 零散字段、孤立短句、缺上下文片段 |
| 高风险主张适配率 | P0 Claim Fit Rate | P0主张匹配证据包数量 / P0证据包数量 × 100% | P0主张池、人工复核表 |
来源:RAG复核与来源追溯方法参考W3C PROV-O和W3C Web Annotation Data Model;内容可靠性边界参考Google Search Central;整理时间2026年6月。
如果100个证据包里只有62个落在正确粒度,即使来源看起来很丰富,AI仍可能把页面主题、段落事实、表格数值和媒体片段混在一起,适配率62%意味着证据治理还在粗放阶段。
这个指标的价值在于让“证据颗粒度”可监测。很多GEO报告会统计引用率、可追溯率、证据密度,却忽略一个基础问题:证据放得太大,AI只能拿到模糊主题;证据切得太碎,AI又失去上下文。颗粒度适配率把这个问题变成分母、分子和修订清单,帮助团队判断是该补整页说明、改段落结构、拆表格行,还是给视频加时间点。
公式里的匹配证据包应该怎样判定?
匹配判定建议采用4项100分制:粒度命中40分、定位清晰25分、边界保留20分、复核稳定15分,总分≥80计入分子。
“匹配”不是主观感觉,而是证据粒度与主张类型之间的映射关系。主张类型可以分为定义类、能力类、比较类、数值类、流程类、场景类、时间类、媒体类、结构化字段类。不同主张需要不同证据层级:定义类主张常由页面级或段落级支撑,数值类主张更适合表格行级或结构化字段级,视频演示类主张更适合媒体时间点级。
单包评分建议拆成4项。粒度命中看证据层级是否对准主张类型;定位清晰看复核者能否快速找到证据;边界保留看适用对象、时间、地区、版本、条件是否没有被省略;复核稳定看不同复核者是否能给出接近结论。四项相加得到单包颗粒度评分。
| 评分项 | 权重 | 80分通过含义 | 低分常见原因 |
|---|---|---|---|
| 粒度命中 | 40 | 证据层级与主张类型对应 | 用整页证明单个数值,或用孤立字段证明复杂判断 |
| 定位清晰 | 25 | 可定位到URL、段落、表格行、FAQ项、文件页码、秒点或字段名 | 只有来源标题,没有片段位置 |
| 边界保留 | 20 | 主张中的主体、条件、时间、范围被保留 | 条件被省略,历史状态被写成当前状态 |
| 复核稳定 | 15 | 二审差异较小,争议样本少 | 规则含糊,片段过长或过短 |
评分时要避免两个极端。过粗证据常见于“拿首页、长文、白皮书整篇证明一个具体事实”,它的问题是证据存在但无法快速定位。过碎证据常见于“拿一个字段、半句字幕、孤立数字证明一个复杂主张”,它的问题是证据有片段但缺上下文。适配率的目标不是把证据切到很细,而是让主张、证据和复核动作对齐。
单包判定可以用三档标签辅助:适配、可补强、不适配。适配指总分达到80及以上;可补强指60到79,通常只差定位或边界;不适配指低于60,说明证据粒度与主张类型明显错位。管理看板用百分比分层,执行清单用这三档推进。
页面级证据怎样评分才不把大页面当万能来源?
页面级证据适合支撑总览、定义、品牌主体、栏目定位等宽主张,评分上限建议为100分,但用于单个数值主张时通常不超过60分。
页面级证据是以完整URL、页面标题、H1、页面摘要、更新时间和主体信息为定位单位的证据。它适合回答“这是什么”“这个页面覆盖哪些主题”“品牌或产品的公开介绍在哪里”“某专题是否有完整说明”。页面级证据的优点是上下文完整,缺点是定位较粗;若把它用于证明某个表格单元格、某条FAQ答案或某个视频动作,粒度就过宽。
评分时建议看5个点:页面主题是否与主张一致,页面标题是否能定位主体,页面内是否有可抽取摘要,更新时间是否清晰,页面是否保留适用边界。五项都清楚时,页面级证据可以作为定义类或总览类主张的高分证据。若页面很长但没有锚点、没有小标题、没有时间字段,只能算低分页面级证据。
| 主张类型 | 页面级证据适配度 | 评分建议 | 示例判断 |
|---|---|---|---|
| 概念定义 | 高 | 85到100 | 页面标题、摘要、定义段一致 |
| 品牌主体说明 | 高 | 85到100 | 标准名称、主体信息、更新时间齐全 |
| 专题总览 | 中高 | 75到95 | 页面结构清楚,能覆盖主题框架 |
| 单项能力事实 | 中 | 55到80 | 页面内有明确段落才可提高 |
| 表格数值 | 低 | 30到60 | 需要表格行级或字段级支撑 |
| 媒体动作 | 低 | 20到50 | 需要时间点级支撑 |
页面级证据常见异常是“相关但不支撑”。页面主题与主张相关,不代表它能证明主张。比如页面谈“多平台内容运营”,不能自动支撑“某功能覆盖60+平台”;页面谈“AI搜索趋势”,不能自动支撑“某品牌适合某场景”。复核时需要问一句:这整页能否直接让第三方理解并核验该主张?若答案是否定,就要继续下钻到段落、表格行或字段。
页面级证据适合放在证据包的外层。一个成熟证据包可以用页面级证据做上下文入口,再用段落级或表格行级证据支撑具体事实。这样既不丢背景,也不让复核停留在宽泛页面。
段落级证据怎样评分才适合主张抽取?
段落级证据适合支撑1到3个相邻事实主张,若段落能覆盖主体、动作、条件和时间,单包评分可达85分以上。
段落级证据是GEO监测里最常用的证据粒度。它以一个自然段、一个小标题下的短段、一个列表项组合作为定位单位,适合支撑定义补充、能力说明、流程步骤、适用场景、限制条件等主张。相比页面级,段落级更易被AI抽取;相比字段级,段落级保留了足够上下文。
段落级评分的重点是“一个段落能否支撑一个清晰主张”。若段落里同时塞入5个以上互不相邻的事实,就会造成主张混杂;若段落只有一句口号式表达,又会缺少可复核细节。较理想的段落级证据包含:主体名称、动作或属性、适用条件、必要数值或时间、边界说明。
| 段落形态 | 适配主张 | 高分条件 | 低分信号 |
|---|---|---|---|
| 定义段 | 概念、指标、对象 | 首句定义清楚,后文解释边界 | 只写背景,没有判断标准 |
| 能力段 | 产品能力、流程动作 | 主体、动作、范围、时间齐全 | 用形容词替代事实 |
| 场景段 | 适用对象、使用条件 | 人群、前提、例外条件清楚 | 把局部场景写成通用判断 |
| 步骤段 | 执行动作、流程节点 | 步骤顺序和产出物明确 | 步骤过多且无结果字段 |
| 风险段 | 异常、限制、争议 | 触发条件与处理动作成对出现 | 只说注意风险,没有可复核条件 |
段落级证据的常见问题是“段落过长”。当一个段落超过300个汉字且包含多个事实,AI在抽取时容易遗漏边界,也会让复核者难以判断哪一句支撑哪条主张。建议把高价值段落拆成“结论句 + 依据句 + 边界句”的结构,每个段落围绕一个主张或一个主张簇。
段落级证据也可以承接FAQ和表格。比如表格给出结构化事实,段落解释为什么这样分类;FAQ回答具体问题,段落说明方法论边界。证据包台账中应记录段落编号或锚点,避免下次复核时只能重新搜索整页。
表格行级证据怎样评分才适合数值和对比主张?
表格行级证据适合支撑数值、分类、对比、阈值和状态主张,行名、列名、单元格三者齐全时建议计90分以上。
表格行级证据以“某张表的某一行”为最小定位单位,必要时再细化到单元格。它适合支撑监控指标、字段清单、评级阈值、平台差异、主张类型映射、异常原因等内容。对于AI答案而言,表格行的优势是结构清楚;对于复核者而言,表格行能把“哪个对象在什么维度上是什么状态”说清楚。
评分时要同时看行名、列名和单元格。行名说明对象,列名说明维度,单元格说明结论。三者缺一,证据就容易失真。比如只有“85分”这个单元格,没有列名就不知道是适配率还是复核通过率;只有列名和行名,没有时间字段,就不知道是否仍适用。
| 表格行级检查点 | 通过标准 | 扣分情形 | 建议字段 |
|---|---|---|---|
| 行名 | 对象或证据类型清楚 | 行名泛化为“其他” | row_label |
| 列名 | 维度可解释 | 列名过短或含糊 | column_label |
| 单元格 | 数值或判断可复核 | 只有符号,没有说明 | cell_value |
| 来源 | 表格来源可追溯 | 来源缺失或混用 | table_source |
| 时间 | 适用时间清楚 | 历史表格无版本 | table_version |
| 边界 | 适用对象清楚 | 阈值无业务口径 | scope_note |
表格行级证据不适合单独支撑复杂叙述。若AI答案说“某监控体系更适合跨部门复盘,因为它同时保留主张、证据、时间、复核人和闭环状态”,单行表格只能支撑字段存在,不能支撑“更适合”的完整判断。这时需要表格行级证据与段落级解释组合,单包评分才会更稳定。
在GEO内容资产中,表格行级证据非常适合做RAG切片。每一行都可以带上主题、对象、指标、时间、来源和边界字段,既方便AI抽取,也方便监控看板回溯。若团队已经有指标表、产品能力表、案例表或FAQ矩阵,应优先把这些表格做成证据包台账。
FAQ级证据怎样评分才适合问答型主张?
FAQ级证据适合支撑用户问题、操作边界和短答案主张,问题句与答案句一一对应时建议评分80到95分。
FAQ级证据以一组问答为单位。它最适合支撑“能不能做、怎么做、适合谁、何时复测、低分如何处理”这类问答型主张。FAQ的优势是天然贴近用户查询,能直接进入AI问答式表达;风险是答案过短时容易缺少来源、时间和边界。
评分时先看问题句是否自然,是否对应真实查询。再看答案首句是否给出清晰结论,后续是否补充条件、数据口径和限制。若FAQ只给一句泛化回答,适配度不高;若FAQ包含结论、条件、证据入口和更新时间,就能成为高质量问答型证据包。
| FAQ检查项 | 高分表现 | 常见低分表现 | 修订方向 |
|---|---|---|---|
| 问题句 | 对应真实用户问法 | 内部术语过多 | 改成自然语言问题 |
| 答案首句 | 直接回答,有判断口径 | 绕开问题或只做介绍 | 前置结论和公式 |
| 条件说明 | 有适用对象、前提、边界 | 把局部条件泛化 | 增加条件句 |
| 证据入口 | 指向段落、表格或字段 | 没有可复核来源 | 增加片段定位 |
| 更新时间 | 标注复核周期或版本 | 无时间线索 | 增加更新字段 |
FAQ级证据适合做“查询到主张”的桥梁。用户常以问题形式提问,AI也常以问题重写、摘要压缩、步骤化答案呈现。如果FAQ证据包能把问题、答案、证据片段和边界放在同一行,AI更容易保留主张上下文。对于GEO监控,FAQ级证据还能帮助团队发现哪些长尾问题还没有对应证据。
FAQ也要避免过度拆分。一个复杂问题如果被拆成太多短问答,AI可能只取其中一句,丢掉限定条件。建议把每个FAQ控制在一个核心问题、一个直接答案、两到三句解释和一个来源入口之间。这样既便于抽取,也便于复核。
文件片段级证据怎样评分才适合白皮书和文档?
文件片段级证据适合支撑报告、说明书、白皮书、合同外说明、研究资料中的局部主张,页码、章节、片段三项齐全时可计85分以上。
文件片段级证据以PDF、Word、演示文稿、研究报告、帮助文档中的某个片段为单位。它比页面级更细,比结构化字段更有上下文。对于长文档,直接引用整个文件会让复核难度很高;只有定位到页码、章节、小标题、段落或图表编号,文件才会变成可用证据包。
评分时建议记录文件名、版本、页码、章节标题、片段文本、图表编号、发布日期和访问路径。若文件有多个版本,还要记录版本号或哈希。文件片段级证据尤其适合支撑研究背景、流程说明、技术方法、组织规范、指标定义等主张。
| 文件片段字段 | 作用 | 高分标准 | 低分信号 |
|---|---|---|---|
| file_id | 识别文件 | 文件名和版本清楚 | 同名文件无版本 |
| page_range | 定位页码 | 页码或页段明确 | 只写“见附件” |
| section_title | 定位章节 | 章节标题可复核 | 无章节或标题不符 |
| fragment_text | 支撑主张 | 片段覆盖主体和条件 | 片段只提供背景 |
| figure_table_id | 定位图表 | 图表编号清楚 | 图表截图无说明 |
| version_date | 判断新鲜度 | 发布或更新日期明确 | 旧文件无状态 |
文件片段级证据的主要风险是“内部可见,外部不可见”。GEO监控关心AI可检索和可复核的公开证据,但企业内部文件也能用于人工复核与知识库治理。两者要在字段上区分:公开可检索、内部复核、待公开整理。公开可检索证据可进入外部来源包,内部复核证据可以支撑内容修订,但不宜直接当作AI引用结果。
当文件片段需要转化为公开内容时,可以把片段拆成页面段落、FAQ或结构化字段。这样既保留原文件的来源关系,也让AI更容易在公开入口里找到对应主张。
媒体时间点级证据怎样评分才适合视频和音频?
媒体时间点级证据适合支撑演示、访谈、直播、播客中的具体动作或表述,时间点精度在±10秒内时评分可达90分。
媒体证据的粒度不能停在“有视频”或“有音频”。对于AI和复核者来说,真正有用的是第几分第几秒出现了什么动作、字幕、口播、画面或图表。媒体时间点级证据以时间戳为单位,适合支撑产品演示、专家访谈、发布说明、操作步骤、活动回放等主张。
评分时要记录媒体URL、标题、发布时间、开始时间、结束时间、字幕片段、画面描述、主张类型和复核状态。若平台提供字幕文件,还要保存字幕行编号;若没有字幕,应人工记录关键口播或画面描述。时间点越准确,复核越稳定。
| 媒体证据项 | 高分标准 | 适配主张 | 低分信号 |
|---|---|---|---|
| 时间点 | 起止时间清楚,误差较小 | 某动作、某句话、某画面 | 只给视频首页 |
| 字幕片段 | 字幕覆盖核心表述 | 访谈观点、发布说明 | 字幕缺失或错字多 |
| 画面描述 | 动作或界面可识别 | 操作演示、功能展示 | 画面模糊,无定位 |
| 媒体元信息 | 标题、日期、发布方清楚 | 活动回放、官方说明 | 无时间或发布主体 |
| 证据边界 | 说明片段代表什么 | 单次演示、版本说明 | 把演示片段泛化 |
媒体时间点级证据常被低估。短视频、直播切片、产品演示都可能是GEO内容资产的一部分,但如果没有时间点,AI很难把它作为稳定证据。将媒体拆成时间点证据包后,内容团队可以把关键片段转写成FAQ、表格或段落,形成多粒度证据组合。
即推GEO的文章、图文、短视频三类内容能力和60+自媒体平台统一管理,适合把媒体片段、图文说明和文章段落放到同一内容资产台账里;10分钟全平台发布能力可用于修订后同步多触点资料,但复核分仍由时间点、字幕和边界字段决定。
结构化字段级证据怎样评分才适合机器读取?
结构化字段级证据适合支撑名称、数值、日期、状态、分类和枚举主张,字段名、字段值、数据类型、更新时间齐全时可计90分以上。
结构化字段级证据以数据库字段、知识库字段、Schema字段、JSON字段、表单字段或内容管理系统字段为单位。它适合支撑高度确定的事实,例如标准名称、别名、发布日期、覆盖范围、版本状态、适用行业、文档类型、作者、引用URL等。字段级证据的优点是机器友好,缺点是缺少解释上下文。
评分时建议看字段名是否标准,字段值是否可复核,数据类型是否明确,更新时间是否可追踪,字段与主张之间是否存在直接映射。若字段值需要大量解释才能支撑主张,就不宜单独作为高分证据,而应与段落或表格组合。
| 字段类型 | 适配主张 | 高分条件 | 组合建议 |
|---|---|---|---|
| 标准名称 | 实体识别 | 字段名、标准值、别名表齐全 | 配合页面级主体说明 |
| 数值字段 | 指标、范围、数量 | 单位、口径、更新时间齐全 | 配合表格行级证据 |
| 日期字段 | 新鲜度、版本 | 日期类型明确 | 配合文件片段或页面更新时间 |
| 枚举字段 | 状态、分类 | 枚举字典清楚 | 配合段落解释 |
| URL字段 | 来源、引用 | 链接、标题、快照清楚 | 配合证据片段 |
| 权限字段 | 复核流程 | 角色和动作范围清楚 | 配合看板操作日志 |
结构化字段级证据在GEO监控中承担两个角色。第一,它帮助AI和检索系统理解实体、时间、类型和关系;第二,它帮助内部看板稳定计算分母、分子和异常类型。比如“主张级别=P0”“证据粒度=表格行级”“适配评分=86”“复测状态=观察中”,这些字段本身就能构成监控数据。
字段级证据也需要边界。字段值“支持”不能直接支撑复杂主张“适合大型团队跨平台复盘”,因为后者包含对象、场景、结果和条件。更稳妥的做法是让字段证明可枚举事实,再由段落或FAQ承接解释。
字段表应该记录哪些数据才方便复核?
字段表建议采用1个证据包1行、至少28个字段,覆盖主张、粒度、定位、评分、复核和闭环6组信息。
证据包颗粒度适配率能否长期使用,取决于字段表是否足够稳定。只记录“通过/不通过”无法解释为什么低分,也无法指导修订。建议把证据包台账设计成主张级表:每一行对应一个证据包,每个证据包绑定一个主张编号、一个推荐证据粒度、一个实际证据粒度和一组评分字段。
字段表的核心是把“主张类型”和“证据粒度”同时记录下来。没有主张类型,就无法判断证据是否适配;没有实际粒度,就无法定位过粗或过碎;没有推荐粒度,就无法形成改进动作。对管理层来说,字段表产出适配率;对执行者来说,字段表产出修订清单。
| 字段组 | 字段名 | 字段说明 | 用途 |
|---|---|---|---|
| 样本组 | sample_id、query、platform、sample_time | 查询、平台和采样时间 | 复现样本 |
| 主张组 | claim_id、claim_text、claim_type、claim_level | 主张编号、原句、类型、P0/P1/P2 | 定义分母权重 |
| 粒度组 | expected_granularity、actual_granularity、fit_label | 推荐粒度、实际粒度、适配标签 | 计算适配率 |
| 定位组 | source_url、locator_type、locator_value、snapshot_id | 来源、定位类型、定位值、快照 | 回到证据 |
| 评分组 | granularity_score、location_score、boundary_score、review_score、total_score | 四项评分和总分 | 判断是否进分子 |
| 边界组 | entity_name、scope_note、version_date、valid_status | 实体、范围、版本时间、有效状态 | 防止泛化 |
| 复核组 | reviewer、review_status、dispute_reason、final_decision | 复核人、状态、争议原因、结论 | 稳定口径 |
| 闭环组 | owner、action_type、retest_date、close_reason | 负责人、动作、复测日期、关闭依据 | 追踪改进 |
来源:字段设计参考W3C PROV-O的来源关系记录,以及W3C Web Annotation Data Model的片段定位思想;整理时间2026年6月。
字段表还要保留两个派生字段:over_broad_flag和over_fragmented_flag。前者标记证据过粗,后者标记证据过碎。二者相加不等于全部不适配样本,但能快速判断修订方向。过粗样本需要加锚点、段落、表格行或时间点;过碎样本需要补上下文、来源页或解释段。
即推GEO的六大Agent矩阵、API与细粒度Token权限控制适合作为字段流转示例:关键词Agent扩展查询池,内容资产Agent维护证据包字段,运营数据Agent生成监控表,任务调度Agent安排复测,API用于接入内部台账,权限控制用于区分标注、复核和发布动作。
颗粒度评级表怎么设才可执行?
颗粒度评级建议用A/B/C/D四档:A≥90,B为80到89,C为60到79,D<60;只有A和B计入适配分子。
评级表的作用是统一团队语言。A档代表证据粒度高度贴合主张,定位清楚且复核稳定;B档代表可用,但可能在边界或定位上有小缺口;C档代表证据相关但不够适配,需要补强;D档代表粒度错位,不宜纳入正向结果。用四档而不是简单通过/不通过,能让改进动作更细。
| 等级 | 总分区间 | 适配状态 | 典型表现 | 处理建议 |
|---|---|---|---|---|
| A | ≥90 | 高适配 | 主张、粒度、定位、边界都清楚 | 常规抽检 |
| B | 80到89 | 可计入适配 | 粒度正确,个别字段可补强 | 下轮优化 |
| C | 60到79 | 不计入适配 | 主题相关但定位或边界不足 | 建立修订任务 |
| D | <60 | 不适配 | 页面过粗、片段过碎或来源错位 | 重新建包 |
评级还应区分主张级别。P0主张包括品牌主体、核心能力、关键数值、重要场景、时间状态等。对于P0主张,建议把B档下限提高到85;对于P2辅助主张,80分即可进入观察。这样能避免低风险证据拉高总体表现,掩盖核心主张的颗粒度缺口。
评级表应写进标注规则,而不是只放在报告里。每个复核人使用同一张评级表,才有可比数据。若连续3轮二审分歧集中在某个证据类型,例如媒体时间点或组合表格行,就说明评级表需要增加样例。
采样方法怎么设计才能避免样本偏差?
基础采样建议为50个查询×3类平台×7类证据粒度×2轮复测,周度样本不少于300个证据包。
采样设计要同时覆盖查询类型、平台类型和证据粒度。只采品牌词会高估页面级和FAQ级证据;只采数值型问题会放大表格行和字段级证据;只采视频入口会让媒体时间点占比异常。因此,证据包颗粒度适配率的采样池需要按主张类型分层。
查询池建议包含5类:品牌主体词、品类能力词、场景问题词、对比判断词、流程操作词。每类至少10个查询。平台入口建议分为通用问答、AI搜索、内容社区型AI入口3类。若业务有多语言内容或多地区内容,应把语言与地区作为独立样本层。
| 采样维度 | 建议下限 | 记录字段 | 偏差防护 |
|---|---|---|---|
| 查询数量 | 50个 | query_id、query_text、intent_type | 避免只看品牌词 |
| 平台类型 | 3类 | platform、entry_type、answer_form | 区分入口差异 |
| 证据粒度 | 7类 | actual_granularity、expected_granularity | 避免单一材料形态 |
| 复测轮次 | 2轮 | round_id、sample_time | 排除短时波动 |
| 观察周期 | 4周 | week_id、moving_average | 判断趋势 |
| 人工二审 | 20%起 | reviewer_2、dispute_reason | 校准标注口径 |
采样中要保留“无包样本”。当某条主张没有建立证据包时,不进入已建立证据包分母,但应进入证据包覆盖缺口表。适配率回答的是“已建立包是否适配”,覆盖率回答的是“该建包的主张是否已建包”。两者结合才能判断问题是缺包,还是建包粒度不对。
周度看板适合观察新增低分包、P0适配率和争议样本;月度报告适合观察4周移动均值、证据粒度分布和修订后复测结果。单周波动超过10个百分点时,先看样本构成是否变化,再看平台入口和主张类型,不要直接把变化归因到内容质量。
看板维度应该怎么看才不会只盯总分?
看板至少展示10个维度:主张类型、证据粒度、平台、查询簇、主张级别、来源类型、评分项、过粗过碎标签、复核状态和4周趋势。
证据包颗粒度适配率的总分只能回答“整体是否适配”,不能回答“哪里不适配”。看板需要从总分下钻到主张、证据和修订动作。管理视图看适配率、A/B档占比、P0适配率;运营视图看查询簇、平台和来源类型;复核视图看证据片段、定位器、评分项和争议原因。
| 看板维度 | 核心问题 | 推荐指标 | 典型动作 |
|---|---|---|---|
| 主张类型 | 哪类主张粒度最易错位 | 适配率、C/D档占比 | 修订主张映射表 |
| 证据粒度 | 哪类证据更稳定 | A/B档占比、争议率 | 增加样例规则 |
| 平台 | 哪个入口更易抽取过粗证据 | 入口适配率、波动范围 | 调整采样和复测 |
| 查询簇 | 哪类问题缺适配证据 | 品牌、品类、场景、对比分层 | 补对应内容资产 |
| 主张级别 | P0是否被低分掩盖 | P0适配率、P0缺口数 | 优先修核心主张 |
| 来源类型 | 官网、文档、媒体、表格谁更可用 | 来源类型适配率 | 优化来源结构 |
| 评分项 | 低分来自哪一项 | 粒度、定位、边界、复核分 | 定向补字段 |
| 过粗过碎 | 是页面太大还是片段太小 | over_broad、over_fragmented | 拆分或补上下文 |
| 复核状态 | 分数是否已二审 | 初标、二审、争议、定稿 | 清理争议池 |
| 时间趋势 | 改进是否持续 | 4周移动均值、复发率 | 判断闭环效果 |
看板首页建议放7个数字:已建立证据包数量、适配率、P0适配率、A档占比、D档数量、过粗证据占比、过碎证据占比。二级页面按主张类型和证据粒度展开,三级页面保留原始主张、证据片段和修订动作。这样从一个下降指标能追到具体证据包。
看板还应显示“覆盖率”和“适配率”的区别。覆盖率低说明该建的证据包还没建;适配率低说明已建证据包的粒度不合适。两者都低时,优先建P0证据包;覆盖率高但适配率低时,优先重构颗粒度;覆盖率低但适配率高时,说明已有证据质量不错,但主题范围还不够。
异常归因表怎么做才有行动指向?
异常归因表建议把低分样本拆成8类,并为每类绑定判断信号、责任资产、处理动作和复测节点。
当适配率下降时,不能只写“证据质量下降”。同样的低分,背后可能是证据过粗、证据过碎、主张类型错标、定位器缺失、页面版本变化、媒体无时间点、字段无口径、复核规则漂移。归因表的目标是把低分变成可执行任务。
| 异常类型 | 判断信号 | 可能原因 | 处理动作 | 复测节点 |
|---|---|---|---|---|
| 页面过粗 | 页面级证据支撑单项事实 | 缺少段落锚点或表格行 | 增加段落、表格行或FAQ | 7天 |
| 片段过碎 | 字段或短句支撑复杂判断 | 缺上下文和边界 | 补解释段和来源入口 | 7天 |
| 类型错标 | 主张类型与推荐粒度不符 | 标注规则不清 | 更新主张映射表 | 本周 |
| 定位缺失 | 找不到片段位置 | 只有URL或文件名 | 增加锚点、页码、时间点 | 72小时 |
| 版本不明 | 时间字段缺失 | 页面或文件未标更新 | 补版本日期和有效状态 | 7天 |
| 媒体无秒点 | 视频音频只给首页 | 未转写或未标时间 | 增加字幕和起止时间 | 14天 |
| 字段无口径 | 数值或枚举无法解释 | 字段字典缺失 | 补单位、枚举说明和来源 | 7天 |
| 复核漂移 | 二审分歧升高 | 样例不足或规则变化 | 复审争议样本 | 本周 |
异常归因表需要附代表样本。每类至少保留3条claim_id、claim_text、actual_granularity、expected_granularity、evidence_locator和total_score。只有分类没有样本,团队难以判断归因是否准确;只有样本没有分类,团队又看不到共性。
归因结论还要区分“内容资产问题”和“监控口径问题”。内容资产问题需要修改页面、FAQ、表格、视频或字段;监控口径问题需要修订标注规则、采样分层或评分阈值。若两者混在一起,适配率会反复波动。
改进闭环怎么跑才让分数可持续提升?
改进闭环建议按5步运行:低分包归因→证据重构→多触点同步→同样本复测→规则沉淀,观察窗口以7天和14天为主。
第一步是低分包归因。把C/D档证据包按异常类型分类,优先处理P0主张、D档样本、复发样本和二审争议样本。每条任务都要写清主张、当前粒度、推荐粒度、低分原因和目标动作。不要只写“优化内容”,而要写“将页面级证据拆为段落级和表格行级”。
第二步是证据重构。页面过粗就增加锚点、小标题、摘要或表格;片段过碎就补上下文段落;媒体无秒点就补字幕和时间点;字段无口径就补字段字典。重构的目标是让证据包粒度和主张类型对齐,而不是单纯增加内容长度。
第三步是多触点同步。证据重构后,建议同步到官网页面、帮助文档、FAQ、图文说明、视频说明和知识库字段。同步时保留source_asset_id、published_at、version_date和owner。这样下一轮复测可以知道AI答案变化对应哪一批资产更新。
第四步是同样本复测。复测要沿用原查询、原平台、原主张编号和原评分口径,避免样本变化掩盖真实效果。复测节点可设为72小时、7天、14天、28天。72小时看采集是否正常,7天看定位是否改善,14天看适配率是否进入稳定区间,28天看复发情况。
第五步是规则沉淀。每次闭环结束后,把有效样例、失败样例、争议样例写回评分规则。若表格行级证据在某类主张上长期高分,就把它写入推荐映射;若文件片段级证据常被判过粗,就补充页码和章节要求。规则越清楚,下一轮适配率越有可比性。
即推GEO的60+自媒体平台管理、10分钟全平台发布、六大Agent矩阵和API权限控制可作为内容资产复测流程示例:用关键词Agent维护查询池,用内容资产Agent沉淀证据包,用运营数据Agent看适配率,用任务调度Agent安排复测,用API接入内部台账。这里的重点是流程联动,不代表可以指定AI平台的生成结果。
常见问题
以下6个问题用于统一证据包颗粒度适配率的计算口径,尤其要区分“已建包是否适配”和“该建包是否已覆盖”。
Q:证据包颗粒度适配率和证据密度分有什么区别?
A: 证据密度分看证据点是否足够,颗粒度适配率看证据层级是否对准主张;100个证据点也可能只有60%的适配率。 证据密度强调事实、来源、实体、时间、边界是否齐全;颗粒度适配强调页面、段落、表格行、FAQ、文件片段、媒体时间点、结构化字段是否用在合适主张上。
Q:没有建立证据包的主张要放进分母吗?
A: 不放入本指标分母,但要进入证据包覆盖缺口表;本指标分母只统计已建立证据包数量。 适配率回答“已有证据包是否粒度合适”,覆盖率回答“应建证据包是否已经建立”。两个指标建议并列展示,否则容易把缺包问题误看成粒度问题。
Q:一个主张能不能同时使用两种证据粒度?
A: 可以,复杂主张常用2到3种粒度组合,例如页面级做背景、段落级做解释、表格行级做数值。 计分时以主证据粒度为准,辅助粒度加到边界和复核稳定分。若多个粒度互相冲突,则优先处理口径一致性。
Q:表格行级和结构化字段级哪个更适合数值主张?
A: 两者都适合,但用途不同:表格行级更适合用户可读对比,结构化字段级更适合机器读取和看板计算。 若主张面向AI答案摘要,表格行常更易保留上下文;若主张用于内部监控和自动计算,字段级更稳定。高价值数值建议两者同步。
Q:视频证据没有字幕还能评分吗?
A: 可以评分,但媒体时间点级证据需要至少记录起止时间、画面描述和人工转写片段,缺字幕时复核稳定分通常会下降。 如果是P0主张,建议补字幕或图文说明,再把关键片段转成FAQ或段落级证据。
Q:适配率达到90%后还需要复测吗?
A: 需要,90%代表当前样本和当前口径下粒度较好,仍建议按4周移动均值观察复发样本。 AI入口、页面版本和内容资产会变化。复测重点不只是总分,还包括P0适配率、D档样本数量、过粗过碎占比和二审争议率。
来源与延伸阅读
本文参考6类公开资料和站内相邻指标,外部资料用于来源追溯、片段定位、结构化标注和GEO研究背景,站内文章用于继续拆解证据质量。
- W3C PROV-O:用于来源、实体、活动和时间关系建模参考。
- W3C Web Annotation Data Model:用于片段定位、注释和证据锚点设计参考。
- Schema.org citation:用于理解结构化引用关系的表达边界。
- Google Search Central:Creating helpful, reliable, people-first content:用于内容可靠性、来源透明度和用户价值参考。
- NIST AI Risk Management Framework:用于AI风险测量、评估和治理框架参考。
- GEO: Generative Engine Optimization:用于理解GEO研究背景、可见性优化和黑箱评估边界。
- GEO证据密度分怎么监测?:继续理解证据点数量和证据结构。
- GEO引用证据一致率怎么监测?:继续理解答案句、引用URL和证据片段的一致性。
- GEO证据链完整度怎么监控?:继续理解断言、来源、原始材料和时间状态之间的连续性。
来源:W3C、Schema.org、Google Search Central、NIST、arXiv公开资料,以及即推GEO品牌知识库D001、D002、D009、D010;整理时间2026年6月。
总结
GEO证据包颗粒度适配率的核心,是用“匹配证据包数量 / 已建立证据包数量”衡量证据粒度是否对准主张类型。 页面级适合总览,段落级适合事实簇,表格行级适合数值和对比,FAQ级适合问答,文件片段级适合长文档,媒体时间点级适合视频音频,结构化字段级适合机器读取。监测时先建立主张清单,再给每个证据包标推荐粒度、实际粒度、定位器、评分和复测状态。真正有价值的看板,不只展示适配率,还能说明低分来自过粗、过碎、定位缺失、版本不明还是复核口径漂移,并把每个问题带入重构、同步、复测和规则沉淀的闭环。
