业务链路 从请求缺口到上线回验 节点数字是可查看的案例数;点击展开,再次点击收起。 打开案例工作台 离 离线内容生产interactive-creator · 原 topic + narration 2 个案例 ↓ 创 在线创作模型请求beehive · 需补传 topic + narration 2 个案例 ↓ 文 文本创作模型请求creator · narration 字段待补 5 个案例 ↓ 请求汇流 请求与缺口保留上游原始输入 01搜索服务记录 no_hit搜索完成但没有合适素材,保存本次请求与过滤条件9个案例展开 ↓ 02读取原始 topic + narration从数据表取回原文;不再把画面描述或 focus_text 当成完整需求9个案例展开 ↓ Query 生成先改写,再做语义去重 03提取实体并改写检索 Query新版目标:人物使用标准英文全名;按不同角度生成 3–8 条 Query5个案例展开 ↓ 04Query Embedding 语义去重余弦阈值 0.85,保留代表 Query 与被合并关系5个案例展开 ↓ 05与运行中 Seed 去重仅处理 usable=true 的 Query;命中活跃 Seed 则复用,不重复投递5个案例展开 ↓ 投递与抓取一次性三平台补采 06投递三平台一次性 SeedYT / TikTok / Instagram · 线上无素材补充 · P1 · 一次性5个案例展开 ↓ 07Crawler 3.1 搜索与抓取查看 queue、run、平台返回量与失败原因;校验拆包保留在详情5个案例展开 ↓ 找回与上线候选、资产、理解与回验 08筛选候选素材按 candidate_key 去重,记录过滤阶段、原因与实际入库结果5个案例展开 ↓ 09绑定正式素材通过验收的内容写入 AssetCenter 并获得 asset_id4个案例展开 ↓ 10理解素材内容生成片段描述,并判断素材是否可用3个案例展开 ↓ 11上线并可搜索完成入库和索引,确认线上可以搜到2个案例展开 ↓ 12回验并闭环用原 topic、narration 与过滤条件再搜一次,确认缺口真的已解决1个案例展开 ↓ 当前环节 环节案例 0 个案例异常案例优先显示 收起↑ 环节边界关键产物待载入关键字段— 搜索本环节案例 已显示 0 / 0显示更多
共 0 个缺口 case · 覆盖 0 条 no_hit 事件样例数据1 / 1 缺口 / 原始 Topic来源链路原始上下文Query / 语义去重Seed / 找回内容理解上线链路进度 没有匹配的缺口清除部分筛选,或检查搜索词是否过于具体。清除筛选
当前瓶颈按积压量 × SLA 超时排序 理解完成但未上线4Asset Center · 最老 31h · SLA 24h seed → asset 绑定缺失3Crawler 3.1 · 阻断端到端归因 Topic / Narration 未同时透传6beehive / creator · 目前多由画面描述或 focus 兜底 人物 Query 未通过全名规则2Query Rewrite · alias 需归一为标准英文全名
数据质量守卫这些条件一旦破坏,老板看到的比例就不可信 EVENT ID必须按 event_id 去重快照中 request_id 有 24 条复用;按 request_id 会少算或覆盖真实搜索事件。 SAMPLE CAPTOP 2,000 不是全量原文件达到 2,000 行上限。未拿到全量前,只能看样本结构,不能报总体增长。 QUERY VERSION当前 v5 与新版后置校验要分组当前 v5 支持 1 primary + 0–7 variants;新版要求至少 3 条,并新增人物标准英文全名 validator,不能混报。 GROUP / ITEMGroup usable 不代替单条校验姓名全称、英文、词数等规则按 query_candidate 判断;一条失败不应拖死整组。 LINEAGEseed → asset 是一级 SLA没有回执映射,就无法证明某条改写到底找回了什么,也无法评价 Query。 QUALITY互动量不等于理解质量ROI 可评估检索效率;caption、domain、content_role、rating 才评估语义可用性。
责任边界每类断点由谁处理 INPUT上游创作字段 QUERYQuery Rewrite改写 DEDUPContent Ops去重 SEEDCrawler 3.1投递 FILTERCrawler 3.1抓取 ASSETAsset Center上线
阶段时延p50 / p95 必须来自同一完整日窗口 上下文对齐8m / 31m目标 < 45m Query 改写17m / 43m目标 < 60m Query 去重12m / 38m目标 < 45m 首次回采4.2h / 13h目标 < 18h 内容理解1.7h / 9h目标 < 12h 上线回链6.4h / 31h目标 < 24h
端到端实体链一对多关系必须保留,不能在 Excel 里压成单行文本 1. no_hit 事件event_id一次真实未命中;保留 request 与过滤条件。 2. 原始上下文event_idtopic+narration记录值、来源、证据角色和缺失状态。 3. Query Groupquery_group_idquery_id一个缺口、实体与 3–8 条候选 Query。 4. Query 去重dedupe_idmember_query_idsEmbedding 代表 Query、合并关系与阈值。 5. 平台 Seed 决策query_idplatform每条保留 Query × 三平台的 create / reuse / blocked。 6. 候选与资产run_idasset_id候选过滤、正式绑定与完整抓取血缘。 7. 内容理解asset_idjob_idcaption、domain、role、rating 与版本。 8. 上线与回验asset_idevent_id可搜索上线,并用原 topic+narration 复测。
老板指标定义每个比例都明确对象、分母与排除项 原始上下文完整率event with topic+narration / no_hit event按来源拆分;画面描述或 focus 兜底不算完整透传。 Query 可用率usable query_group / rewritten query_groupGroup 可用不替代单条姓名、语言与长度校验。 Query 去重保留率kept query_candidate / input query_candidate按 Query 数计算;不能继续沿用旧线索聚类的 2000→500 估算。 找回率kept query with ≥1 asset receipt / dispatched query按逻辑 Query,不按平台副本或资产数量,避免重复放大。 理解可用率usable asset / understood asset依据 domain、content_role、rating;互动量只能评价回采效率。 端到端闭环率verified-hit query_group / usable query_group至少一个可搜索资产,且原 topic、narration 与过滤条件复测命中。 血缘完整度records with all required joins / eligible records缺任一 event→query_group→query→seed→asset→online 连接就不算完整。
接入时必须守住的 4 个协议口径已确认项按合同展示;未确认项继续显式标记,避免混入日常指标合同约束 PRIORITY / CRON业务优先级与调度策略已映射Crawler 合同使用 high / normal / low 与 cron;P1→high,一次性任务→cron=0。调度由确定性策略生成,不依赖模型自由输出。 QUERY RANGE3–8 条下限需要落到 validator当前 v5 最多已支持 1 primary + 0–7 variants,但未强制至少 3 条;新版人物全名规则也应作为候选级后置校验上线。 FULL NAME人物名称按 Query 单条校验Messi、Kobe 等别名必须归一成标准英文全名;失败的候选应剔除,其他合格 Query 继续。 TIMEZONE / COHORT完整日与时区必须成为合同当前样本只覆盖约 12.5 小时且达到 2,000 上限。应固定 cohort_window、timezone、declared_sample_size 和 truncation 标记。