Skip to content

路线图与非目标 ​

项目的判断标准只有一条:这个功能是否让系统在正确性、权限安全、可评测性、可观测性或可运行性上产生可验证的提升。答案是否定的,就不进当前路线图。

一、里程碑 ​

Grounded Access 路线图

按每周 10–15 小时估算,合计约 41 个工作日。

里程碑范围状态
M0 Walking skeletondemo 身份与 JWT、Markdown 入库、sparse 与 dense 检索、租户隔离、评测 CLI、CI 冒烟与安全门禁已完成
M1a 数据集与基线扩充到 70 条用例(改写、数字、跨章节、hard negatives)、BM25 参考行、配对置信区间、并发入库安全已完成
M1b 检索比较异步入库契约一次迁移、停用与删除清理、chunker v1、RRF hybrid 与公开结论(hybrid 未超过 dense)已完成
M2 授权访问标签与完整决策表、适用范围过滤、审计事件、最小 trace 元数据、property-based 测试、威胁模型进行中:完整决策表、基于属性的测试、带标签的数据集 v2、更严格的门禁、适用范围过滤(含 asOf)已完成
M3 重排与回答带降级的 cross-encoder 重排、上下文构建、结构化引用与校验、拒答计划中
M4 运维与发布OpenTelemetry trace 与脱敏测试、dashboard、故障与压力测试、v0.1 报告与发布清单计划中

M1 被拆成两批是有原因的:M0 时 13 条可回答用例里 dense 全部命中,那时调 RRF 参数等于对着噪声调参。先让数据集有区分度,再做 hybrid。 M1a 完成后,配对比较已经能分辨出 dense、BM25 与 FTS 之间的差异,hybrid 才有了可以被判定的对照组。

二、明确不做的事 ​

第一阶段不碰:知识图谱与 GraphRAG、自主 Agent 与工具编排、通用工作流或拖拽 UI、OCR 与多模态、模型微调与训练平台、自研向量库或 embedding 模型、同时支持多个向量后端、Kubernetes 与多云 Terraform、完整 IAM / SSO / SCIM 后台、以复杂前端替代核心工程证据。

这些不是「永远不做」,而是需要先有证据。例如 GraphRAG 要同时满足四个条件才立项:baseline 已完成且评测稳定、失败分析显示某类查询无法靠 chunk 检索与元数据过滤解决、能为该类查询建立独立数据集与指标、质量收益与索引成本 / 延迟 / 运维复杂度能与 baseline 对比。

三、待决问题 ​

#问题当前倾向
Q1项目名是否沿用 grounded-access暂定沿用,公开前检查重名与商标
Q5b用哪个 cross-encoder 重排模型基础规模、许可证宽松、先在笔记本上实测延迟
Q6本地生成模型路径任意 OpenAI 兼容端点,文档以 Ollama 举例,生成保持可选
Q7身份:demo JWT 还是 OIDCv0.1 用 demo JWT 并写明信任边界,OIDC 后置
Q8查询路径的审计写入v0.1 同步写、失败关闭;压测显示压力再改 outbox
Q11asOf 的语义已决定(ADR-0005):只按有效期过滤当前版本,不选取历史版本;历史选取留待后续 ADR
Q12是否引入第二个检索后端(如 Elasticsearch)做对照M2 之后;先定义后端能力契约,不能下推授权谓词的后端必须拒绝启动而不是退化为应用层过滤

Q11 与 Q12 是这一轮评审新增的。它们共享同一条原则:先定义语义,再改实现,不让 schema 或接口跑在能力前面。

四、最小成功定义 ​

如果时间有限,项目仍要保住这条闭环:

  1. 一套原创、带权限标注与 ground truth 的公开企业知识数据集;
  2. sparse、dense、hybrid、hybrid+rerank 四组可复现实验;
  3. 检索时的租户隔离与 ABAC,安全负例在 CI 中零泄漏;
  4. 带引用与拒答的查询 API;
  5. 一条完整的 OpenTelemetry trace;
  6. 一份诚实的英文 benchmark 与失败分析;
  7. 一个任何人都能运行的、无需 API key 的 demo。

做到这七项,项目就已经和普通 RAG demo 拉开距离;其余功能只有在增强这条证据链时才值得加入。

小结 ​

路线图的作用不是排期,而是拒绝的依据。每次想加东西时回到那条判断标准:它带来的提升,能不能被公开数据、测试或 benchmark 证明?

文章以 CC BY-NC-SA 4.0 授权 · 代码片段以 MIT 授权