FORMLESS · CONTENT GAP OPS

素材缺口运营平台

按顺序查看每个素材缺口如何被记录、补采、上线并最终回验。

业务链路

从请求缺口到上线回验

节点数字是可查看的案例数;点击展开,再次点击收起。

请求汇流
外部业务合同缺口信号与归因
仅 F1真实缺素材补采主链
补采准备文档已定义,运行回执待接
交付代码Query 与平台 Seed 严格分层
外部回执候选、资产、理解与上线
链路抽样

每个环节抽一条看看

同一数据与批次的结果固定;点环节回到上方展开全部 case,点 case 查看血缘证据。

抽样批次 #1

    Gap workbench

    缺口工作台

    从原始 Topic 一路展开到上线资产;不是每条 no_hit 都应该投种子。

    0 个缺口簇 · 聚合 0 条线索事件
    缺口 / 原始 Topic来源链路诊断归因聚类改写投递 / 找回内容理解上线链路进度

    没有匹配的缺口

    清除部分筛选,或检查搜索词是否过于具体。

    Pipeline health

    链路健康

    看每条来源链路在哪个环节掉速,并把问题交给真正的 owner。

    结构演示

    来源 × 阶段完整度

    有完整 join key 的记录占比;不是业务成功率

    来源归因聚类Queryseed 回执内容理解上线回链

    当前瓶颈

    按积压量 × SLA 超时排序

    理解完成但未上线4
    Asset Center · 最老 31h · SLA 24h
    seed → asset 绑定缺失3
    Crawler 3.1 · 阻断端到端归因
    F1 尚未生成可用 Query6
    内容采集 · 多为缺主体 / 禁用意图
    诊断 dependency_failed2
    诊断服务 · X1 不能当素材缺口

    数据质量守卫

    这些条件一旦破坏,老板看到的比例就不可信

    EVENT ID
    必须按 event_id 去重
    快照中 request_id 有 24 条复用;按 request_id 会少算或覆盖真实搜索事件。
    SAMPLE CAP
    TOP 2,000 不是全量
    原文件达到 2,000 行上限。未拿到全量前,只能看样本结构,不能报总体增长。
    VERSION
    诊断版本必须分组
    judge standard、prompt、Select contract 或模型不同,归因占比不可直接合并。
    X1 DENOMINATOR
    依赖失败不能静默删除
    X1 仍属于诊断覆盖分母;HTTP 200 也不等于业务归因成功。
    LINEAGE
    seed → asset 是一级 SLA
    没有回执映射,就无法证明某条改写到底找回了什么,也无法评价 Query。
    QUALITY
    互动量不等于理解质量
    ROI 可评估检索效率;caption、domain、content_role、rating 才评估语义可用性。

    责任边界

    no_hit 代码应回到哪里

    A1–A2Planner
    规划
    B0–B4Search
    召回
    C3Select
    终选
    D1–D8Filter
    过滤
    F1Content Ops
    补采
    F2Request
    改需求

    阶段时延

    p50 / p95 必须来自同一完整日窗口

    诊断
    8m / 31m
    目标 < 45m
    清洗聚类
    17m / 43m
    目标 < 60m
    Query 改写
    12m / 38m
    目标 < 45m
    首次回采
    4.2h / 13h
    目标 < 18h
    内容理解
    1.7h / 9h
    目标 < 12h
    上线回链
    6.4h / 31h
    目标 < 24h
    Data contract

    口径与接入

    平台真正落地依赖八张可回溯实体表;核心不是 UI,而是 join key 从头到尾不断。

    端到端实体链

    一对多关系必须保留,不能在 Excel 里压成单行文本

    1. 缺口事件
    event_id
    一次线上搜索事实;request_id 只做辅助。
    2. 诊断结果
    snapshot_id
    event_id
    主归因、证据、覆盖、版本与耗时。
    3. 线索聚类
    cluster_id
    member_event_ids
    翻译后 embedding 聚类与代表线索。
    4. 逻辑 Query
    query_id
    cluster_id
    主 Query、变体、意图和可用性。
    5. 搜索种子
    seed_id
    query_id
    三平台展开、优先级、cron 与投递状态。
    6. 资产回执
    seed_id
    asset_id
    证明某条种子实际找回了什么。
    7. 内容理解
    asset_id
    run_id
    caption、domain、role、rating 与版本。
    8. 上线与回验
    asset_id
    event_id
    可搜索上线,并用原条件复测是否真正补上。

    建议字段

    按对象存,不把所有字段塞进一张宽表

    老板指标定义

    每个比例都明确对象、分母与排除项

    诊断覆盖率
    classified event / unique event_id
    X1 和未诊断保留在分母。只看 HTTP 200 会高估。
    真实缺口率
    F1 event / classified event
    只回答 no_hit 中有多少真的是库缺素材,不等于补采规模。
    找回率
    cluster with ≥1 asset receipt / dispatched cluster
    按簇,不按资产数量;否则重复资产会虚增成功率。
    理解可用率
    usable asset / understood asset
    依据 domain、content_role、rating;互动量只能评价回采效率。
    端到端闭环率
    verified-hit cluster / actionable F1 cluster
    至少一个可搜索在线资产,可沿 seed_id 回到原始 event_id,并且原条件复测已命中。
    血缘完整度
    records with all required joins / eligible records
    缺任一 event→cluster→query→seed→asset→online 连接就不算完整。

    接入时必须守住的 4 个协议口径

    已确认项按合同展示;未确认项继续显式标记,避免混入日常指标

    合同约束
    PRIORITY / CRON
    业务优先级与调度策略已映射
    Crawler 合同使用 high / normal / low 与 cron;P1→high,一次性任务→cron=0。调度由确定性策略生成,不依赖模型自由输出。
    POLICY VERSION
    不同业务路线不能共用禁词表
    no_hit 改写允许 interview / celebration;球星事实路线全局禁 interview / press conference。必须按 source_route 绑定 policy_version。
    PROBE MODE
    V1 是否做平台 live 探测
    最终方案说首版不做,提示词备注却假设会探测。每次 run 必须落 probe_mode,指标按模式拆开。
    TIMEZONE / COHORT
    完整日与时区必须成为合同
    当前样本只覆盖约 12.5 小时且达到 2,000 上限。应固定 cohort_window、timezone、declared_sample_size 和 truncation 标记。