游戏测试 LLMCase-V4

zhangbp · 2026年09月08日 · 92 次阅读

技术实现说明(培训教材)

定位:完成年初设定目标:2026 年测试智能化升级技术实现方案 v3 https://testerhome.com/topics/43674
章节体系:本工程本质是领域特化 RAG 系统(策划文档 → 检索增强 → 测试要点/用例生成 → 评估),
章节按 RAG pipeline 阶段编号组织(00-11),每章内以「递进小节」展开(基础→变体→本工程特化)。
每小节固定四段:① 机制一句话;② 数据流图;③ 代码入口(path:line 锚定);④ 复用清单。
骨架版(session#70 立项):小节标题与内容后续对话逐步充实调整。
开发任务排序:任务 1=实现新功能,任务 2=本文档(培训教材)。
维护纪律:涉及下述机制的 change 收尾时,须同步更新本文档对应小节。

00 工程总览与最小链路

  • 00-1 一句话与总架构:策划文档(docx)→ 结构化测试要点与用例 + 全程质量评估;四服务拓扑(convert2md:8000 / generator:8001 / evaluator:8002 / dashboard:8080)与共享层(model_core/modules/common)。
  • 00-2 数据流水线阶段目录总图(data/workspace/01_raw → 02_markdown → 03_entity → 04_point → 05_case → 06_eval,后缀 SRC/ENT/PNT/CAS/EVAL)。
  • 00-3 一次端到端数据旅行叙事(拿一份真实 docx 走完全链)。
  • 00-4 环境与运行(.env / start_all_services / 已知坑速查)。
  • <!-- TODO:全部小节内容 -->

01 数据导入:docx 到 markdown

  • 01-1 简单文本导入(纯文字 docx → md 的基本链路)
  • 01-2 结构化内容(标题层级、列表、加粗等格式映射)
  • 01-3 图文数据(图片抽取 + <!--IMG_REF--> 占位符协议)
  • 01-4 表格数据(docx 表格 → md 表格 → ExcelTableThinking)
  • 01-5 归档契约与版本(单文件 + 行区间、.superseded_ 归档、批次 artifacts.source)
  • <!-- TODO:每小节四段式 -->

02 文本切块:从文档到提取单元

  • 02-1 章节树构建(标题层级=功能层级假设,section 切分)
  • 02-2 辅助段落分流(aux-section:overview 反哺 / boilerplate 跳过)
  • 02-3 正文前约定区切分(preamble:三级识别 + 指导/提取双路,template_chapters.split_preamble
  • 02-4 跨表/跨节块(ExcelTableThinking 块、跨节依赖 Pass 2)
  • <!-- TODO -->

03 实体提取:文本到功能实体图(本工程特化)

  • 03-1 两遍提取(骨架 Pass→细化 Pass→依赖解析)
  • 03-2 prompt 组装与 flag 体系(模板章节 guard 白名单、img 上下文注入、aux 背景)
  • 03-3 实体合并与孤儿挂接、原子性判定
  • 03-4 共享词表体系(template_chapters / aux_sections 单一真相源)
  • <!-- TODO -->

04 向量嵌入

  • 04-1 嵌入模型选型(bge-m3:多语/长文本/延迟基线)
  • 04-2 嵌入什么(实体/要点/用例的向量化对象与粒度)
  • <!-- TODO -->

05 向量存储

  • 05-1 FAISS 索引结构与持久化
  • 05-2 few-shot 样例池(genre/universal 双池、入库治理)
  • <!-- TODO -->

06 检索前处理

  • 06-1 查询构造(从实体/要点生成检索 query)
  • 06-2 三级路由(tier1 项目内 → tier2 品类 → tier3 零样本)
  • 06-3 提问式生成的子树圈定(scope)
  • <!-- TODO -->

07 索引优化(拟,后续调整)

  • <!-- TODO:层级索引、路由隔离的实现 -->

08 检索后处理

  • 08-1 宽召回 + rerank(recall floor、bge reranker)
  • 08-2 检索质量阈值与忠实性(faithfulness,防编造)
  • <!-- TODO -->

09 响应生成:测试要点与用例

  • 09-1 测试要点生成(TP:结构、prompt、few-shot 注入)
  • 09-2 测试用例生成(CAS:步骤/断言、四象限)
  • 09-3 提问式生成双路(单点生成 ask 流)
  • <!-- TODO -->

10 系统评估

  • 10-1 geval judge(LLM 评估)
  • 10-2 critic 四维(单条质量)
  • 10-3 watchdog 双轨交叉验证(确定性 vs LLM 分歧)
  • 10-4 A/B 实验方法学(本工程反复使用的判据体系)
  • <!-- TODO -->

11 高级机制(拟,后续调整)

  • 11-1 few-shot 价值结论(产量放大器而非质量提升器)
  • 11-2 批次血缘与产物回溯(sessions/backfill)
  • 11-3 可观测性(结构化日志 TAG 协议 / log_doctor / Langfuse / flag 收敛)
  • <!-- TODO -->

附录 A:复用依赖地图(拟)

  • <!-- TODO:每机制的外部依赖与最小可抽离边界 -->

编写进度

章节 状态 完成时间
00 总览与最小链路 待写
01 数据导入 待写
02 文本切块 待写
03 实体提取 待写
04 向量嵌入 待写
05 向量存储 待写
06 检索前处理 待写
07 索引优化(拟) 待定
08 检索后处理 待写
09 响应生成 待写
10 系统评估 待写
11 高级机制(拟) 待定
暂无回复。
需要 登录 后方可回复, 如果你还没有账号请点击这里 注册