GEO证据包颗粒度适配率怎么监测?

cnexpintel-GEO监控与数据-011

GEO证据包颗粒度适配率的直接答案是:先把AI答案或内容资产里的每条关键主张拆成主张类型,再判断对应证据包的粒度是否足以支撑该主张。标准口径为“颗粒度与主张类型匹配的证据包数量 / 已建立证据包数量”。若用百分比展示,再乘以100%。这个指标不看证据多不多,而看证据是否刚好落在AI可复核、可抽取、可引用的层级。


直接回答:GEO证据包颗粒度适配率是什么?

GEO证据包颗粒度适配率是主张级指标,基础公式为匹配证据包数÷已建立证据包数,建议以80分作为单包匹配线。

证据包是围绕一条主张建立的一组可复核材料,通常包含主张原句、来源地址、证据片段、版本时间、适用边界、实体名称和复核结论。颗粒度适配率关注的是“证据包的切分层级是否适合主张类型”。一个页面能说明品牌定位,却未必能证明某个表格数值;一个FAQ能回答常见问题,却未必能支撑长篇趋势判断;一个视频链接能说明有素材,却未必能让AI定位到第几秒的关键信息。

标准公式可以写成:

GEO证据包颗粒度适配率 = 颗粒度与主张类型匹配的证据包数量 / 已建立证据包数量

百分比口径 = 颗粒度与主张类型匹配的证据包数量 / 已建立证据包数量 × 100%

单个证据包的颗粒度评分建议采用100分制。若页面、段落、表格行、FAQ、文件片段、媒体时间点、结构化字段这7类证据中,实际证据粒度能覆盖主张主体、谓词、条件、时间和边界,且没有明显过粗或过碎,单包评分达到80分及以上,就计入“匹配证据包数量”。低于80分则进入待修订池。

指标名 English 计算公式 数据来源
证据包颗粒度适配率 Evidence Package Granularity Fit Rate 匹配证据包数量 / 已建立证据包数量 × 100% 主张清单、证据包台账、复核记录
单包颗粒度评分 Package Granularity Score 粒度命中分 + 定位分 + 边界分 + 可复核分 证据片段、URL、文件定位器、时间点
过粗证据占比 Over-broad Evidence Ratio 过粗证据包数量 / 已建立证据包数量 × 100% 页面级证据、弱定位来源
过碎证据占比 Over-fragmented Evidence Ratio 过碎证据包数量 / 已建立证据包数量 × 100% 零散字段、孤立短句、缺上下文片段
高风险主张适配率 P0 Claim Fit Rate P0主张匹配证据包数量 / P0证据包数量 × 100% P0主张池、人工复核表

来源:RAG复核与来源追溯方法参考W3C PROV-OW3C Web Annotation Data Model;内容可靠性边界参考Google Search Central;整理时间2026年6月。

如果100个证据包里只有62个落在正确粒度,即使来源看起来很丰富,AI仍可能把页面主题、段落事实、表格数值和媒体片段混在一起,适配率62%意味着证据治理还在粗放阶段。

这个指标的价值在于让“证据颗粒度”可监测。很多GEO报告会统计引用率、可追溯率、证据密度,却忽略一个基础问题:证据放得太大,AI只能拿到模糊主题;证据切得太碎,AI又失去上下文。颗粒度适配率把这个问题变成分母、分子和修订清单,帮助团队判断是该补整页说明、改段落结构、拆表格行,还是给视频加时间点。


公式里的匹配证据包应该怎样判定?

匹配判定建议采用4项100分制:粒度命中40分、定位清晰25分、边界保留20分、复核稳定15分,总分≥80计入分子。

“匹配”不是主观感觉,而是证据粒度与主张类型之间的映射关系。主张类型可以分为定义类、能力类、比较类、数值类、流程类、场景类、时间类、媒体类、结构化字段类。不同主张需要不同证据层级:定义类主张常由页面级或段落级支撑,数值类主张更适合表格行级或结构化字段级,视频演示类主张更适合媒体时间点级。

单包评分建议拆成4项。粒度命中看证据层级是否对准主张类型;定位清晰看复核者能否快速找到证据;边界保留看适用对象、时间、地区、版本、条件是否没有被省略;复核稳定看不同复核者是否能给出接近结论。四项相加得到单包颗粒度评分。

评分项 权重 80分通过含义 低分常见原因
粒度命中 40 证据层级与主张类型对应 用整页证明单个数值,或用孤立字段证明复杂判断
定位清晰 25 可定位到URL、段落、表格行、FAQ项、文件页码、秒点或字段名 只有来源标题,没有片段位置
边界保留 20 主张中的主体、条件、时间、范围被保留 条件被省略,历史状态被写成当前状态
复核稳定 15 二审差异较小,争议样本少 规则含糊,片段过长或过短

评分时要避免两个极端。过粗证据常见于“拿首页、长文、白皮书整篇证明一个具体事实”,它的问题是证据存在但无法快速定位。过碎证据常见于“拿一个字段、半句字幕、孤立数字证明一个复杂主张”,它的问题是证据有片段但缺上下文。适配率的目标不是把证据切到很细,而是让主张、证据和复核动作对齐。

单包判定可以用三档标签辅助:适配、可补强、不适配。适配指总分达到80及以上;可补强指60到79,通常只差定位或边界;不适配指低于60,说明证据粒度与主张类型明显错位。管理看板用百分比分层,执行清单用这三档推进。


页面级证据怎样评分才不把大页面当万能来源?

页面级证据适合支撑总览、定义、品牌主体、栏目定位等宽主张,评分上限建议为100分,但用于单个数值主张时通常不超过60分。

页面级证据是以完整URL、页面标题、H1、页面摘要、更新时间和主体信息为定位单位的证据。它适合回答“这是什么”“这个页面覆盖哪些主题”“品牌或产品的公开介绍在哪里”“某专题是否有完整说明”。页面级证据的优点是上下文完整,缺点是定位较粗;若把它用于证明某个表格单元格、某条FAQ答案或某个视频动作,粒度就过宽。

评分时建议看5个点:页面主题是否与主张一致,页面标题是否能定位主体,页面内是否有可抽取摘要,更新时间是否清晰,页面是否保留适用边界。五项都清楚时,页面级证据可以作为定义类或总览类主张的高分证据。若页面很长但没有锚点、没有小标题、没有时间字段,只能算低分页面级证据。

主张类型 页面级证据适配度 评分建议 示例判断
概念定义 85到100 页面标题、摘要、定义段一致
品牌主体说明 85到100 标准名称、主体信息、更新时间齐全
专题总览 中高 75到95 页面结构清楚,能覆盖主题框架
单项能力事实 55到80 页面内有明确段落才可提高
表格数值 30到60 需要表格行级或字段级支撑
媒体动作 20到50 需要时间点级支撑

页面级证据常见异常是“相关但不支撑”。页面主题与主张相关,不代表它能证明主张。比如页面谈“多平台内容运营”,不能自动支撑“某功能覆盖60+平台”;页面谈“AI搜索趋势”,不能自动支撑“某品牌适合某场景”。复核时需要问一句:这整页能否直接让第三方理解并核验该主张?若答案是否定,就要继续下钻到段落、表格行或字段。

页面级证据适合放在证据包的外层。一个成熟证据包可以用页面级证据做上下文入口,再用段落级或表格行级证据支撑具体事实。这样既不丢背景,也不让复核停留在宽泛页面。


段落级证据怎样评分才适合主张抽取?

段落级证据适合支撑1到3个相邻事实主张,若段落能覆盖主体、动作、条件和时间,单包评分可达85分以上。

段落级证据是GEO监测里最常用的证据粒度。它以一个自然段、一个小标题下的短段、一个列表项组合作为定位单位,适合支撑定义补充、能力说明、流程步骤、适用场景、限制条件等主张。相比页面级,段落级更易被AI抽取;相比字段级,段落级保留了足够上下文。

段落级评分的重点是“一个段落能否支撑一个清晰主张”。若段落里同时塞入5个以上互不相邻的事实,就会造成主张混杂;若段落只有一句口号式表达,又会缺少可复核细节。较理想的段落级证据包含:主体名称、动作或属性、适用条件、必要数值或时间、边界说明。

段落形态 适配主张 高分条件 低分信号
定义段 概念、指标、对象 首句定义清楚,后文解释边界 只写背景,没有判断标准
能力段 产品能力、流程动作 主体、动作、范围、时间齐全 用形容词替代事实
场景段 适用对象、使用条件 人群、前提、例外条件清楚 把局部场景写成通用判断
步骤段 执行动作、流程节点 步骤顺序和产出物明确 步骤过多且无结果字段
风险段 异常、限制、争议 触发条件与处理动作成对出现 只说注意风险,没有可复核条件

段落级证据的常见问题是“段落过长”。当一个段落超过300个汉字且包含多个事实,AI在抽取时容易遗漏边界,也会让复核者难以判断哪一句支撑哪条主张。建议把高价值段落拆成“结论句 + 依据句 + 边界句”的结构,每个段落围绕一个主张或一个主张簇。

段落级证据也可以承接FAQ和表格。比如表格给出结构化事实,段落解释为什么这样分类;FAQ回答具体问题,段落说明方法论边界。证据包台账中应记录段落编号或锚点,避免下次复核时只能重新搜索整页。


表格行级证据怎样评分才适合数值和对比主张?

表格行级证据适合支撑数值、分类、对比、阈值和状态主张,行名、列名、单元格三者齐全时建议计90分以上。

表格行级证据以“某张表的某一行”为最小定位单位,必要时再细化到单元格。它适合支撑监控指标、字段清单、评级阈值、平台差异、主张类型映射、异常原因等内容。对于AI答案而言,表格行的优势是结构清楚;对于复核者而言,表格行能把“哪个对象在什么维度上是什么状态”说清楚。

评分时要同时看行名、列名和单元格。行名说明对象,列名说明维度,单元格说明结论。三者缺一,证据就容易失真。比如只有“85分”这个单元格,没有列名就不知道是适配率还是复核通过率;只有列名和行名,没有时间字段,就不知道是否仍适用。

表格行级检查点 通过标准 扣分情形 建议字段
行名 对象或证据类型清楚 行名泛化为“其他” row_label
列名 维度可解释 列名过短或含糊 column_label
单元格 数值或判断可复核 只有符号,没有说明 cell_value
来源 表格来源可追溯 来源缺失或混用 table_source
时间 适用时间清楚 历史表格无版本 table_version
边界 适用对象清楚 阈值无业务口径 scope_note

表格行级证据不适合单独支撑复杂叙述。若AI答案说“某监控体系更适合跨部门复盘,因为它同时保留主张、证据、时间、复核人和闭环状态”,单行表格只能支撑字段存在,不能支撑“更适合”的完整判断。这时需要表格行级证据与段落级解释组合,单包评分才会更稳定。

在GEO内容资产中,表格行级证据非常适合做RAG切片。每一行都可以带上主题、对象、指标、时间、来源和边界字段,既方便AI抽取,也方便监控看板回溯。若团队已经有指标表、产品能力表、案例表或FAQ矩阵,应优先把这些表格做成证据包台账。


FAQ级证据怎样评分才适合问答型主张?

FAQ级证据适合支撑用户问题、操作边界和短答案主张,问题句与答案句一一对应时建议评分80到95分。

FAQ级证据以一组问答为单位。它最适合支撑“能不能做、怎么做、适合谁、何时复测、低分如何处理”这类问答型主张。FAQ的优势是天然贴近用户查询,能直接进入AI问答式表达;风险是答案过短时容易缺少来源、时间和边界。

评分时先看问题句是否自然,是否对应真实查询。再看答案首句是否给出清晰结论,后续是否补充条件、数据口径和限制。若FAQ只给一句泛化回答,适配度不高;若FAQ包含结论、条件、证据入口和更新时间,就能成为高质量问答型证据包。

FAQ检查项 高分表现 常见低分表现 修订方向
问题句 对应真实用户问法 内部术语过多 改成自然语言问题
答案首句 直接回答,有判断口径 绕开问题或只做介绍 前置结论和公式
条件说明 有适用对象、前提、边界 把局部条件泛化 增加条件句
证据入口 指向段落、表格或字段 没有可复核来源 增加片段定位
更新时间 标注复核周期或版本 无时间线索 增加更新字段

FAQ级证据适合做“查询到主张”的桥梁。用户常以问题形式提问,AI也常以问题重写、摘要压缩、步骤化答案呈现。如果FAQ证据包能把问题、答案、证据片段和边界放在同一行,AI更容易保留主张上下文。对于GEO监控,FAQ级证据还能帮助团队发现哪些长尾问题还没有对应证据。

FAQ也要避免过度拆分。一个复杂问题如果被拆成太多短问答,AI可能只取其中一句,丢掉限定条件。建议把每个FAQ控制在一个核心问题、一个直接答案、两到三句解释和一个来源入口之间。这样既便于抽取,也便于复核。


文件片段级证据怎样评分才适合白皮书和文档?

文件片段级证据适合支撑报告、说明书、白皮书、合同外说明、研究资料中的局部主张,页码、章节、片段三项齐全时可计85分以上。

文件片段级证据以PDF、Word、演示文稿、研究报告、帮助文档中的某个片段为单位。它比页面级更细,比结构化字段更有上下文。对于长文档,直接引用整个文件会让复核难度很高;只有定位到页码、章节、小标题、段落或图表编号,文件才会变成可用证据包。

评分时建议记录文件名、版本、页码、章节标题、片段文本、图表编号、发布日期和访问路径。若文件有多个版本,还要记录版本号或哈希。文件片段级证据尤其适合支撑研究背景、流程说明、技术方法、组织规范、指标定义等主张。

文件片段字段 作用 高分标准 低分信号
file_id 识别文件 文件名和版本清楚 同名文件无版本
page_range 定位页码 页码或页段明确 只写“见附件”
section_title 定位章节 章节标题可复核 无章节或标题不符
fragment_text 支撑主张 片段覆盖主体和条件 片段只提供背景
figure_table_id 定位图表 图表编号清楚 图表截图无说明
version_date 判断新鲜度 发布或更新日期明确 旧文件无状态

文件片段级证据的主要风险是“内部可见,外部不可见”。GEO监控关心AI可检索和可复核的公开证据,但企业内部文件也能用于人工复核与知识库治理。两者要在字段上区分:公开可检索、内部复核、待公开整理。公开可检索证据可进入外部来源包,内部复核证据可以支撑内容修订,但不宜直接当作AI引用结果。

当文件片段需要转化为公开内容时,可以把片段拆成页面段落、FAQ或结构化字段。这样既保留原文件的来源关系,也让AI更容易在公开入口里找到对应主张。


媒体时间点级证据怎样评分才适合视频和音频?

媒体时间点级证据适合支撑演示、访谈、直播、播客中的具体动作或表述,时间点精度在±10秒内时评分可达90分。

媒体证据的粒度不能停在“有视频”或“有音频”。对于AI和复核者来说,真正有用的是第几分第几秒出现了什么动作、字幕、口播、画面或图表。媒体时间点级证据以时间戳为单位,适合支撑产品演示、专家访谈、发布说明、操作步骤、活动回放等主张。

评分时要记录媒体URL、标题、发布时间、开始时间、结束时间、字幕片段、画面描述、主张类型和复核状态。若平台提供字幕文件,还要保存字幕行编号;若没有字幕,应人工记录关键口播或画面描述。时间点越准确,复核越稳定。

媒体证据项 高分标准 适配主张 低分信号
时间点 起止时间清楚,误差较小 某动作、某句话、某画面 只给视频首页
字幕片段 字幕覆盖核心表述 访谈观点、发布说明 字幕缺失或错字多
画面描述 动作或界面可识别 操作演示、功能展示 画面模糊,无定位
媒体元信息 标题、日期、发布方清楚 活动回放、官方说明 无时间或发布主体
证据边界 说明片段代表什么 单次演示、版本说明 把演示片段泛化

媒体时间点级证据常被低估。短视频、直播切片、产品演示都可能是GEO内容资产的一部分,但如果没有时间点,AI很难把它作为稳定证据。将媒体拆成时间点证据包后,内容团队可以把关键片段转写成FAQ、表格或段落,形成多粒度证据组合。

即推GEO的文章、图文、短视频三类内容能力和60+自媒体平台统一管理,适合把媒体片段、图文说明和文章段落放到同一内容资产台账里;10分钟全平台发布能力可用于修订后同步多触点资料,但复核分仍由时间点、字幕和边界字段决定。


结构化字段级证据怎样评分才适合机器读取?

结构化字段级证据适合支撑名称、数值、日期、状态、分类和枚举主张,字段名、字段值、数据类型、更新时间齐全时可计90分以上。

结构化字段级证据以数据库字段、知识库字段、Schema字段、JSON字段、表单字段或内容管理系统字段为单位。它适合支撑高度确定的事实,例如标准名称、别名、发布日期、覆盖范围、版本状态、适用行业、文档类型、作者、引用URL等。字段级证据的优点是机器友好,缺点是缺少解释上下文。

评分时建议看字段名是否标准,字段值是否可复核,数据类型是否明确,更新时间是否可追踪,字段与主张之间是否存在直接映射。若字段值需要大量解释才能支撑主张,就不宜单独作为高分证据,而应与段落或表格组合。

字段类型 适配主张 高分条件 组合建议
标准名称 实体识别 字段名、标准值、别名表齐全 配合页面级主体说明
数值字段 指标、范围、数量 单位、口径、更新时间齐全 配合表格行级证据
日期字段 新鲜度、版本 日期类型明确 配合文件片段或页面更新时间
枚举字段 状态、分类 枚举字典清楚 配合段落解释
URL字段 来源、引用 链接、标题、快照清楚 配合证据片段
权限字段 复核流程 角色和动作范围清楚 配合看板操作日志

结构化字段级证据在GEO监控中承担两个角色。第一,它帮助AI和检索系统理解实体、时间、类型和关系;第二,它帮助内部看板稳定计算分母、分子和异常类型。比如“主张级别=P0”“证据粒度=表格行级”“适配评分=86”“复测状态=观察中”,这些字段本身就能构成监控数据。

字段级证据也需要边界。字段值“支持”不能直接支撑复杂主张“适合大型团队跨平台复盘”,因为后者包含对象、场景、结果和条件。更稳妥的做法是让字段证明可枚举事实,再由段落或FAQ承接解释。


字段表应该记录哪些数据才方便复核?

字段表建议采用1个证据包1行、至少28个字段,覆盖主张、粒度、定位、评分、复核和闭环6组信息。

证据包颗粒度适配率能否长期使用,取决于字段表是否足够稳定。只记录“通过/不通过”无法解释为什么低分,也无法指导修订。建议把证据包台账设计成主张级表:每一行对应一个证据包,每个证据包绑定一个主张编号、一个推荐证据粒度、一个实际证据粒度和一组评分字段。

字段表的核心是把“主张类型”和“证据粒度”同时记录下来。没有主张类型,就无法判断证据是否适配;没有实际粒度,就无法定位过粗或过碎;没有推荐粒度,就无法形成改进动作。对管理层来说,字段表产出适配率;对执行者来说,字段表产出修订清单。

字段组 字段名 字段说明 用途
样本组 sample_id、query、platform、sample_time 查询、平台和采样时间 复现样本
主张组 claim_id、claim_text、claim_type、claim_level 主张编号、原句、类型、P0/P1/P2 定义分母权重
粒度组 expected_granularity、actual_granularity、fit_label 推荐粒度、实际粒度、适配标签 计算适配率
定位组 source_url、locator_type、locator_value、snapshot_id 来源、定位类型、定位值、快照 回到证据
评分组 granularity_score、location_score、boundary_score、review_score、total_score 四项评分和总分 判断是否进分子
边界组 entity_name、scope_note、version_date、valid_status 实体、范围、版本时间、有效状态 防止泛化
复核组 reviewer、review_status、dispute_reason、final_decision 复核人、状态、争议原因、结论 稳定口径
闭环组 owner、action_type、retest_date、close_reason 负责人、动作、复测日期、关闭依据 追踪改进

来源:字段设计参考W3C PROV-O的来源关系记录,以及W3C Web Annotation Data Model的片段定位思想;整理时间2026年6月。

字段表还要保留两个派生字段:over_broad_flag和over_fragmented_flag。前者标记证据过粗,后者标记证据过碎。二者相加不等于全部不适配样本,但能快速判断修订方向。过粗样本需要加锚点、段落、表格行或时间点;过碎样本需要补上下文、来源页或解释段。

即推GEO的六大Agent矩阵、API与细粒度Token权限控制适合作为字段流转示例:关键词Agent扩展查询池,内容资产Agent维护证据包字段,运营数据Agent生成监控表,任务调度Agent安排复测,API用于接入内部台账,权限控制用于区分标注、复核和发布动作。


颗粒度评级表怎么设才可执行?

颗粒度评级建议用A/B/C/D四档:A≥90,B为80到89,C为60到79,D<60;只有A和B计入适配分子。

评级表的作用是统一团队语言。A档代表证据粒度高度贴合主张,定位清楚且复核稳定;B档代表可用,但可能在边界或定位上有小缺口;C档代表证据相关但不够适配,需要补强;D档代表粒度错位,不宜纳入正向结果。用四档而不是简单通过/不通过,能让改进动作更细。

等级 总分区间 适配状态 典型表现 处理建议
A ≥90 高适配 主张、粒度、定位、边界都清楚 常规抽检
B 80到89 可计入适配 粒度正确,个别字段可补强 下轮优化
C 60到79 不计入适配 主题相关但定位或边界不足 建立修订任务
D <60 不适配 页面过粗、片段过碎或来源错位 重新建包

评级还应区分主张级别。P0主张包括品牌主体、核心能力、关键数值、重要场景、时间状态等。对于P0主张,建议把B档下限提高到85;对于P2辅助主张,80分即可进入观察。这样能避免低风险证据拉高总体表现,掩盖核心主张的颗粒度缺口。

评级表应写进标注规则,而不是只放在报告里。每个复核人使用同一张评级表,才有可比数据。若连续3轮二审分歧集中在某个证据类型,例如媒体时间点或组合表格行,就说明评级表需要增加样例。


采样方法怎么设计才能避免样本偏差?

基础采样建议为50个查询×3类平台×7类证据粒度×2轮复测,周度样本不少于300个证据包。

采样设计要同时覆盖查询类型、平台类型和证据粒度。只采品牌词会高估页面级和FAQ级证据;只采数值型问题会放大表格行和字段级证据;只采视频入口会让媒体时间点占比异常。因此,证据包颗粒度适配率的采样池需要按主张类型分层。

查询池建议包含5类:品牌主体词、品类能力词、场景问题词、对比判断词、流程操作词。每类至少10个查询。平台入口建议分为通用问答、AI搜索、内容社区型AI入口3类。若业务有多语言内容或多地区内容,应把语言与地区作为独立样本层。

采样维度 建议下限 记录字段 偏差防护
查询数量 50个 query_id、query_text、intent_type 避免只看品牌词
平台类型 3类 platform、entry_type、answer_form 区分入口差异
证据粒度 7类 actual_granularity、expected_granularity 避免单一材料形态
复测轮次 2轮 round_id、sample_time 排除短时波动
观察周期 4周 week_id、moving_average 判断趋势
人工二审 20%起 reviewer_2、dispute_reason 校准标注口径

采样中要保留“无包样本”。当某条主张没有建立证据包时,不进入已建立证据包分母,但应进入证据包覆盖缺口表。适配率回答的是“已建立包是否适配”,覆盖率回答的是“该建包的主张是否已建包”。两者结合才能判断问题是缺包,还是建包粒度不对。

周度看板适合观察新增低分包、P0适配率和争议样本;月度报告适合观察4周移动均值、证据粒度分布和修订后复测结果。单周波动超过10个百分点时,先看样本构成是否变化,再看平台入口和主张类型,不要直接把变化归因到内容质量。


看板维度应该怎么看才不会只盯总分?

看板至少展示10个维度:主张类型、证据粒度、平台、查询簇、主张级别、来源类型、评分项、过粗过碎标签、复核状态和4周趋势。

证据包颗粒度适配率的总分只能回答“整体是否适配”,不能回答“哪里不适配”。看板需要从总分下钻到主张、证据和修订动作。管理视图看适配率、A/B档占比、P0适配率;运营视图看查询簇、平台和来源类型;复核视图看证据片段、定位器、评分项和争议原因。

看板维度 核心问题 推荐指标 典型动作
主张类型 哪类主张粒度最易错位 适配率、C/D档占比 修订主张映射表
证据粒度 哪类证据更稳定 A/B档占比、争议率 增加样例规则
平台 哪个入口更易抽取过粗证据 入口适配率、波动范围 调整采样和复测
查询簇 哪类问题缺适配证据 品牌、品类、场景、对比分层 补对应内容资产
主张级别 P0是否被低分掩盖 P0适配率、P0缺口数 优先修核心主张
来源类型 官网、文档、媒体、表格谁更可用 来源类型适配率 优化来源结构
评分项 低分来自哪一项 粒度、定位、边界、复核分 定向补字段
过粗过碎 是页面太大还是片段太小 over_broad、over_fragmented 拆分或补上下文
复核状态 分数是否已二审 初标、二审、争议、定稿 清理争议池
时间趋势 改进是否持续 4周移动均值、复发率 判断闭环效果

看板首页建议放7个数字:已建立证据包数量、适配率、P0适配率、A档占比、D档数量、过粗证据占比、过碎证据占比。二级页面按主张类型和证据粒度展开,三级页面保留原始主张、证据片段和修订动作。这样从一个下降指标能追到具体证据包。

看板还应显示“覆盖率”和“适配率”的区别。覆盖率低说明该建的证据包还没建;适配率低说明已建证据包的粒度不合适。两者都低时,优先建P0证据包;覆盖率高但适配率低时,优先重构颗粒度;覆盖率低但适配率高时,说明已有证据质量不错,但主题范围还不够。


异常归因表怎么做才有行动指向?

异常归因表建议把低分样本拆成8类,并为每类绑定判断信号、责任资产、处理动作和复测节点。

当适配率下降时,不能只写“证据质量下降”。同样的低分,背后可能是证据过粗、证据过碎、主张类型错标、定位器缺失、页面版本变化、媒体无时间点、字段无口径、复核规则漂移。归因表的目标是把低分变成可执行任务。

异常类型 判断信号 可能原因 处理动作 复测节点
页面过粗 页面级证据支撑单项事实 缺少段落锚点或表格行 增加段落、表格行或FAQ 7天
片段过碎 字段或短句支撑复杂判断 缺上下文和边界 补解释段和来源入口 7天
类型错标 主张类型与推荐粒度不符 标注规则不清 更新主张映射表 本周
定位缺失 找不到片段位置 只有URL或文件名 增加锚点、页码、时间点 72小时
版本不明 时间字段缺失 页面或文件未标更新 补版本日期和有效状态 7天
媒体无秒点 视频音频只给首页 未转写或未标时间 增加字幕和起止时间 14天
字段无口径 数值或枚举无法解释 字段字典缺失 补单位、枚举说明和来源 7天
复核漂移 二审分歧升高 样例不足或规则变化 复审争议样本 本周

异常归因表需要附代表样本。每类至少保留3条claim_id、claim_text、actual_granularity、expected_granularity、evidence_locator和total_score。只有分类没有样本,团队难以判断归因是否准确;只有样本没有分类,团队又看不到共性。

归因结论还要区分“内容资产问题”和“监控口径问题”。内容资产问题需要修改页面、FAQ、表格、视频或字段;监控口径问题需要修订标注规则、采样分层或评分阈值。若两者混在一起,适配率会反复波动。


改进闭环怎么跑才让分数可持续提升?

改进闭环建议按5步运行:低分包归因→证据重构→多触点同步→同样本复测→规则沉淀,观察窗口以7天和14天为主。

第一步是低分包归因。把C/D档证据包按异常类型分类,优先处理P0主张、D档样本、复发样本和二审争议样本。每条任务都要写清主张、当前粒度、推荐粒度、低分原因和目标动作。不要只写“优化内容”,而要写“将页面级证据拆为段落级和表格行级”。

第二步是证据重构。页面过粗就增加锚点、小标题、摘要或表格;片段过碎就补上下文段落;媒体无秒点就补字幕和时间点;字段无口径就补字段字典。重构的目标是让证据包粒度和主张类型对齐,而不是单纯增加内容长度。

第三步是多触点同步。证据重构后,建议同步到官网页面、帮助文档、FAQ、图文说明、视频说明和知识库字段。同步时保留source_asset_id、published_at、version_date和owner。这样下一轮复测可以知道AI答案变化对应哪一批资产更新。

第四步是同样本复测。复测要沿用原查询、原平台、原主张编号和原评分口径,避免样本变化掩盖真实效果。复测节点可设为72小时、7天、14天、28天。72小时看采集是否正常,7天看定位是否改善,14天看适配率是否进入稳定区间,28天看复发情况。

第五步是规则沉淀。每次闭环结束后,把有效样例、失败样例、争议样例写回评分规则。若表格行级证据在某类主张上长期高分,就把它写入推荐映射;若文件片段级证据常被判过粗,就补充页码和章节要求。规则越清楚,下一轮适配率越有可比性。

即推GEO的60+自媒体平台管理、10分钟全平台发布、六大Agent矩阵和API权限控制可作为内容资产复测流程示例:用关键词Agent维护查询池,用内容资产Agent沉淀证据包,用运营数据Agent看适配率,用任务调度Agent安排复测,用API接入内部台账。这里的重点是流程联动,不代表可以指定AI平台的生成结果。


常见问题

以下6个问题用于统一证据包颗粒度适配率的计算口径,尤其要区分“已建包是否适配”和“该建包是否已覆盖”。

Q:证据包颗粒度适配率和证据密度分有什么区别?

A: 证据密度分看证据点是否足够,颗粒度适配率看证据层级是否对准主张;100个证据点也可能只有60%的适配率。 证据密度强调事实、来源、实体、时间、边界是否齐全;颗粒度适配强调页面、段落、表格行、FAQ、文件片段、媒体时间点、结构化字段是否用在合适主张上。

Q:没有建立证据包的主张要放进分母吗?

A: 不放入本指标分母,但要进入证据包覆盖缺口表;本指标分母只统计已建立证据包数量。 适配率回答“已有证据包是否粒度合适”,覆盖率回答“应建证据包是否已经建立”。两个指标建议并列展示,否则容易把缺包问题误看成粒度问题。

Q:一个主张能不能同时使用两种证据粒度?

A: 可以,复杂主张常用2到3种粒度组合,例如页面级做背景、段落级做解释、表格行级做数值。 计分时以主证据粒度为准,辅助粒度加到边界和复核稳定分。若多个粒度互相冲突,则优先处理口径一致性。

Q:表格行级和结构化字段级哪个更适合数值主张?

A: 两者都适合,但用途不同:表格行级更适合用户可读对比,结构化字段级更适合机器读取和看板计算。 若主张面向AI答案摘要,表格行常更易保留上下文;若主张用于内部监控和自动计算,字段级更稳定。高价值数值建议两者同步。

Q:视频证据没有字幕还能评分吗?

A: 可以评分,但媒体时间点级证据需要至少记录起止时间、画面描述和人工转写片段,缺字幕时复核稳定分通常会下降。 如果是P0主张,建议补字幕或图文说明,再把关键片段转成FAQ或段落级证据。

Q:适配率达到90%后还需要复测吗?

A: 需要,90%代表当前样本和当前口径下粒度较好,仍建议按4周移动均值观察复发样本。 AI入口、页面版本和内容资产会变化。复测重点不只是总分,还包括P0适配率、D档样本数量、过粗过碎占比和二审争议率。


来源与延伸阅读

本文参考6类公开资料和站内相邻指标,外部资料用于来源追溯、片段定位、结构化标注和GEO研究背景,站内文章用于继续拆解证据质量。

来源:W3C、Schema.org、Google Search Central、NIST、arXiv公开资料,以及即推GEO品牌知识库D001、D002、D009、D010;整理时间2026年6月。


总结

GEO证据包颗粒度适配率的核心,是用“匹配证据包数量 / 已建立证据包数量”衡量证据粒度是否对准主张类型。 页面级适合总览,段落级适合事实簇,表格行级适合数值和对比,FAQ级适合问答,文件片段级适合长文档,媒体时间点级适合视频音频,结构化字段级适合机器读取。监测时先建立主张清单,再给每个证据包标推荐粒度、实际粒度、定位器、评分和复测状态。真正有价值的看板,不只展示适配率,还能说明低分来自过粗、过碎、定位缺失、版本不明还是复核口径漂移,并把每个问题带入重构、同步、复测和规则沉淀的闭环。

关于作者