FORMLESS · CONTENT GAP OPS

素材缺口运营平台

按顺序查看每个素材缺口如何被记录、补采、上线并最终回验。

业务链路

从请求缺口到上线回验

节点数字是可查看的案例数;点击展开,再次点击收起。

请求汇流
请求与缺口保留上游原始输入
Query 生成先改写,再做语义去重
投递与抓取一次性三平台补采
找回与上线候选、资产、理解与回验
链路抽样

每个环节抽一条看看

节点数字按缺口 Case 计;这里保留当前环节的 Query、Seed、候选或资产实体 ID,点开即定位证据。

抽样批次 #1

    Gap workbench

    缺口工作台

    从原始 Topic 一路展开到上线资产;不是每条 no_hit 都应该投种子。

    0 个缺口 case · 覆盖 0 条 no_hit 事件
    缺口 / 原始 Topic来源链路原始上下文Query / 语义去重Seed / 找回内容理解上线链路进度

    没有匹配的缺口

    清除部分筛选,或检查搜索词是否过于具体。

    Pipeline health

    链路健康

    看每条来源链路在哪个环节掉速,并把问题交给真正的 owner。

    结构演示

    来源 × 阶段完整度

    有完整 join key 的记录占比;不是业务成功率

    来源原始上下文Query 生成Query 去重Seed 回执内容理解上线回链

    当前瓶颈

    按积压量 × SLA 超时排序

    理解完成但未上线4
    Asset Center · 最老 31h · SLA 24h
    seed → asset 绑定缺失3
    Crawler 3.1 · 阻断端到端归因
    Topic / Narration 未同时透传6
    beehive / creator · 目前多由画面描述或 focus 兜底
    人物 Query 未通过全名规则2
    Query Rewrite · alias 需归一为标准英文全名

    数据质量守卫

    这些条件一旦破坏,老板看到的比例就不可信

    EVENT ID
    必须按 event_id 去重
    快照中 request_id 有 24 条复用;按 request_id 会少算或覆盖真实搜索事件。
    SAMPLE CAP
    TOP 2,000 不是全量
    原文件达到 2,000 行上限。未拿到全量前,只能看样本结构,不能报总体增长。
    QUERY VERSION
    当前 v5 与新版后置校验要分组
    当前 v5 支持 1 primary + 0–7 variants;新版要求至少 3 条,并新增人物标准英文全名 validator,不能混报。
    GROUP / ITEM
    Group usable 不代替单条校验
    姓名全称、英文、词数等规则按 query_candidate 判断;一条失败不应拖死整组。
    LINEAGE
    seed → asset 是一级 SLA
    没有回执映射,就无法证明某条改写到底找回了什么,也无法评价 Query。
    QUALITY
    互动量不等于理解质量
    ROI 可评估检索效率;caption、domain、content_role、rating 才评估语义可用性。

    责任边界

    每类断点由谁处理

    INPUT上游创作
    字段
    QUERYQuery Rewrite
    改写
    DEDUPContent Ops
    去重
    SEEDCrawler 3.1
    投递
    FILTERCrawler 3.1
    抓取
    ASSETAsset Center
    上线

    阶段时延

    p50 / p95 必须来自同一完整日窗口

    上下文对齐
    8m / 31m
    目标 < 45m
    Query 改写
    17m / 43m
    目标 < 60m
    Query 去重
    12m / 38m
    目标 < 45m
    首次回采
    4.2h / 13h
    目标 < 18h
    内容理解
    1.7h / 9h
    目标 < 12h
    上线回链
    6.4h / 31h
    目标 < 24h
    Data contract

    口径与接入

    平台真正落地依赖八张可回溯实体表;核心不是 UI,而是 join key 从头到尾不断。

    端到端实体链

    一对多关系必须保留,不能在 Excel 里压成单行文本

    1. no_hit 事件
    event_id
    一次真实未命中;保留 request 与过滤条件。
    2. 原始上下文
    event_id
    topic+narration
    记录值、来源、证据角色和缺失状态。
    3. Query Group
    query_group_id
    query_id
    一个缺口、实体与 3–8 条候选 Query。
    4. Query 去重
    dedupe_id
    member_query_ids
    Embedding 代表 Query、合并关系与阈值。
    5. 平台 Seed 决策
    query_id
    platform
    每条保留 Query × 三平台的 create / reuse / blocked。
    6. 候选与资产
    run_id
    asset_id
    候选过滤、正式绑定与完整抓取血缘。
    7. 内容理解
    asset_id
    job_id
    caption、domain、role、rating 与版本。
    8. 上线与回验
    asset_id
    event_id
    可搜索上线,并用原 topic+narration 复测。

    建议字段

    按对象存,不把所有字段塞进一张宽表

    老板指标定义

    每个比例都明确对象、分母与排除项

    原始上下文完整率
    event with topic+narration / no_hit event
    按来源拆分;画面描述或 focus 兜底不算完整透传。
    Query 可用率
    usable query_group / rewritten query_group
    Group 可用不替代单条姓名、语言与长度校验。
    Query 去重保留率
    kept query_candidate / input query_candidate
    按 Query 数计算;不能继续沿用旧线索聚类的 2000→500 估算。
    找回率
    kept query with ≥1 asset receipt / dispatched query
    按逻辑 Query,不按平台副本或资产数量,避免重复放大。
    理解可用率
    usable asset / understood asset
    依据 domain、content_role、rating;互动量只能评价回采效率。
    端到端闭环率
    verified-hit query_group / usable query_group
    至少一个可搜索资产,且原 topic、narration 与过滤条件复测命中。
    血缘完整度
    records with all required joins / eligible records
    缺任一 event→query_group→query→seed→asset→online 连接就不算完整。

    接入时必须守住的 4 个协议口径

    已确认项按合同展示;未确认项继续显式标记,避免混入日常指标

    合同约束
    PRIORITY / CRON
    业务优先级与调度策略已映射
    Crawler 合同使用 high / normal / low 与 cron;P1→high,一次性任务→cron=0。调度由确定性策略生成,不依赖模型自由输出。
    QUERY RANGE
    3–8 条下限需要落到 validator
    当前 v5 最多已支持 1 primary + 0–7 variants,但未强制至少 3 条;新版人物全名规则也应作为候选级后置校验上线。
    FULL NAME
    人物名称按 Query 单条校验
    Messi、Kobe 等别名必须归一成标准英文全名;失败的候选应剔除,其他合格 Query 继续。
    TIMEZONE / COHORT
    完整日与时区必须成为合同
    当前样本只覆盖约 12.5 小时且达到 2,000 上限。应固定 cohort_window、timezone、declared_sample_size 和 truncation 标记。