能力 — 信任断裂
模型能力指数级上升,人的信任线性上升甚至不动。
后果:Agent 只能停在草稿区,进不了主流程。
AI 能跑,不代表能信——别人在造 Agent,我们在给 Agent 出证:用本体把推理链路还原成可检查、可追溯、可约束的证据链,给出置信度与提升空间,并用强化学习闭环持续改进到合规。
不是模型不够强,是没有人能对它的结论负责。
| # | 问题 | 现状 | 鉴证给出的答案 |
|---|---|---|---|
| 1 | 没人说得清它为什么给这个结论 | 只有输入输出日志 | 推理链路本体图 + 逐环节置信度剖面 |
| 2 | 模型升级 / 提示词一改,效果是涨是跌没有对照 | 靠抽样人看 | A/B 对照 + 增量鉴证报告 |
| 3 | 合规与审计要证据,不是要“感觉还行” | 日志只有 prompt / response 对 | 证据双链路(结论→证据→原文 / 证据→规则→本体) |
| 4 | 能力天花板在哪、投多少能提升多少,无法回答 | 拍脑袋排期 | 带价签的提升空间清单 |
三个正在发生的断裂,评测一个都补不上。
模型能力指数级上升,人的信任线性上升甚至不动。
后果:Agent 只能停在草稿区,进不了主流程。
结论有了,但“依据哪条规则、哪份原文、哪次确认”说不清。
后果:出事无法定责,合规直接否掉。
提示词 / 模型 / 数据一变,历史结论无法重放比对。
后果:迭代靠感觉,回归靠运气。
| 维度 | 评测 Benchmark | 鉴证 Attestation |
|---|---|---|
| 对象 | 模型 / 版本 | 具体某条业务链路上的某次决策 |
| 输出 | 一个分数 | 一条可复核的证据链 + 置信度 + 结论 |
| 可复现性 | 换个提示词分数就变 | 给定本体、规则、证据版本,结果可重放 |
| 谁说话 | 厂商自证 | 第三方可复核(本体与约束公开可读) |
| 时序 | 上线前一次性 | 持续:每次决策、每次迭代都出证 |
| 失败时的价值 | 掉了几分 | 指出是哪一环断了、缺什么才能补齐 |
评测回答“它有多强”,鉴证回答“它这次为什么对、能不能被信任、下次怎么还能对”。
分级售卖,也分级交付——我们的目标是把客户从 A0 / A1 带到 A2 / A3。
只有日志
适用:内部试用
结论能点回证据原文
适用:业务辅助决策
推理链路显式化 + 规则约束校验
适用:进入主流程 ✓
约束→奖励→进化→漂移监控全自动,且可重放复现
适用:合规 / 金融 / 医疗 / 政务 ✓
对应客户从“看看靠不靠谱”到“长期合规运营”的完整路径。
对已建成的 Agent 工作流做本体反演,还原其推理链路与逻辑,输出置信度诊断。
角色 · 诊断 —— 告诉你在哪坏
输入 · 一套跑起来的 Agent 工作流
输出 · 推理链路本体图 + 置信度剖面 + 薄弱环节清单
在项目中增补本体建模,用 A/B 对照量化“加本体到底能提升多少、值不值”。
角色 · 处方 —— 告诉你花多少能治好多少
输入 · 诊断结论 + 100 条黄金集
输出 · 带价签的提升空间清单(Δ / 工作量 / 优先级)
用 RL 闭环(APO / VERL / SFT / 本体 Reward / RLVR 3.0)把经验固化,并持续监控与修正漂移。
角色 · 康复 + 体检 —— 长期进化 + 持续监控
输入 · 高置信轨迹 + 约束库 + 漂移基线
输出 · 策略版本进化 + 漂移告警 + 定期复鉴
客户已有一套跑起来的 Agent 工作流,想让飞速“看看靠不靠谱”。
OpenTelemetry Span 全量埋点
不改客户核心代码,采集 LLM 调用、工具调用、检索、人工干预、异常;每个 Span 补挂稳定来源标识(幂等,迟到数据不丢)。
产物:Trace Store 原始轨迹
实体 / 动作 → 行业本体
抽取主体 / 谓词 / 客体,对齐到行业本体中的概念与关系;未命中概念进入缺口清单——这本身就是价值。
产物:概念归位率、缺口清单
节点 = 推理步骤 · 边 = 依赖 / 证据
以证据为边、以推理步骤为节点,重建“输入 → 中间结论 → 最终结论”有向图;标注哪些边有证据支撑、哪些是模型自由发挥。
产物:推理链路本体图
SHACL 形状 + SWRL 规则
逐节点校验:术语一致、量纲 / 口径正确、权限合法、时效有效。
产物:约束满足率、违规定位
置信度 = 本体覆盖度 × 证据支撑度 × 约束满足度
置信度不是模型自己说的概率,而是一个可以由第三方重算的确定量——这是“鉴证”与“自评”的分水岭。
| 维度 | 定义 | 计算方式 | 低分意味着 |
|---|---|---|---|
| 本体覆盖度 | 这条推理链上,有多少环节被本体锚定 | 已归位概念数 / 总概念数 | 大量环节在“无约束自由发挥” |
| 证据支撑度 | 每个结论有多少条可点回原文的证据 | 有证据的边数 / 总边数 | 结论是模型编的,追不回去 |
| 约束满足度 | SHACL / SWRL 约束的通过率 | 通过约束数 / 适用约束数 | 存在明确违规,不能进主流程 |
鉴证报告里最有用的不是那个总分,而是这张剖面图。
| 环节 | 本体覆盖 | 证据支撑 | 约束满足 | 综合置信度 | 定性 |
|---|---|---|---|---|---|
| 意图识别 | 0.92 | 0.60 | 1.00 | 0.55 | 结论对,但依据是模型猜的 |
| 政策检索 | 0.95 | 0.98 | 1.00 | 0.93 | 健康 |
| 条款适用判断 | 0.88 | 0.91 | 0.60 | 0.48 | 违反「新旧政策互斥」约束 |
| 金额计算 | 0.30 | 0.20 | 0.80 | 0.05 | 完全无本体锚定,最危险 |
| 最终答复 | 0.85 | 0.70 | 1.00 | 0.60 | 承接了上游风险 |
金额计算这一环,是整条链路的断裂点。上游再漂亮,也会被它一票否决。
客户接受了诊断,接下来问的一定是:“那我加本体建模,到底能提升多少、值不值”。
| 组别 | 配置 | 说明 |
|---|---|---|
| 对照组 B0 | 客户现状(原提示词 + 原 Agent) | 基线 |
| 实验组 B1 | 仅增补本体建模(不改模型、不改提示词) | 隔离“本体”这一项的净效果 |
| 实验组 B2 | 本体 + 本体 Reward 引导的提示词优化(APO) | 本体 + 进化的叠加效果 |
40 正例 / 30 边界 / 20 负例 / 10 例外。其中“边界”与“例外”是拉开差距的关键——它们专门打击“看起来对”的 Agent。
直接复用抓手一的置信度三维(本体覆盖度 / 证据支撑度 / 约束满足度)+ 业务正确率 + 拒答准确率。
立刻排进下一个迭代
值得立项,但要排期与预算
搭车完成,不单独立项
成本不划算,明确放弃
| 待增补本体构件 | 类型 | 预估增益 Δ | 工作量 | 建议 |
|---|---|---|---|---|
| 金额计算器本体(口径、公式、取整规则) | 领域本体 + 规则 | +0.55 | 3 人日 | ① 立即做 |
| 新旧政策互斥约束 | SHACL 形状 | +0.30 | 0.5 人日 | ① 立即做 |
| 权限与最小可见范围 | 上下文本体 | +0.15 | 2 人日 | ③ 顺手做 |
| 多语言术语映射 | 领域本体 | +0.03 | 15 人日 | ④ 不做 |
这份清单让客户看到的不再是“要不要做本体”,而是“3 人日换 +0.55 置信度”。
注:上表为示意样例,用于说明交付形态;实际项目的 Δ 与工作量以 A/B 实测为准。
客户要的是“越用越好”,而不是“改一次好一次”。
| 工具 | 在本平台中的角色 | 落到哪个模块 | 关键作用 |
|---|---|---|---|
| APO 自动提示词优化 | 从失败轨迹里生成候选提示词,用鉴证指标择优 | 学习层 · Algorithm | 人写提示词 → 证据挑提示词 |
| VERL 强化学习策略训练 | 以鉴证奖励为信号优化 Agent 行为策略 | 学习层 · Algorithm | 从“改提示词”升级到“改策略” |
| SFT 数据蒸馏 | 把一次成功的高置信度轨迹蒸馏成监督样本,固化进模型 | 学习层 · Algorithm | 一次性经验 → 永久能力,不必重训全量 |
| 本体 Reward(无需标注) | 奖励由本体一致性、SHACL 满足度、证据完整度自动生成 | 学习层 ← 数据层 | 破解 RL 最大的成本瓶颈:标注 |
| OpenTelemetry Span 追踪 | 全过程埋点,每个 Span 携带本体锚点(概念 / 规则 / 证据 ID) | 执行层 · Runner | 让“轨迹”天生带语义,而不是一堆字符串 |
| SHACL → Reward 映射 | 把“合规约束”编译成可评分的奖励项 | 数据层 → 学习层 | 让合规从门槛变成优化目标 |
| onto_drift → APO | 检测本体漂移,触发提示词再优化 | 数据层监控 → 学习层 | 让 Agent 不因世界变化而悄悄失效 |
| RLVR 3.0 结构化 Reward | 格式层 / 过程层 / 结果层三层结构化奖励 | 学习层 · Algorithm | 结果 + 过程 + 格式,三层都可验证 |
输出结构合规、字段齐全、量纲正确
判定依据:本体 schema
本体校验推理链路每步有本体锚点与证据;无违规约束
判定依据:SHACL + 证据图谱
SHACL → Reward最终结论与可验证真值一致
判定依据:仿真真值 / 标准条款 / 黄金集 / 人工确认
RLVR三层独立计分、加权汇总。好处是:结果错了能告诉你错在格式、过程还是结论——而不是只给一个总奖励。
INNOVATION 01
奖励 = r_schema 结构合规 + r_shacl 约束满足 + r_evidence 证据完整 + r_truth 结果可验证,四项全部自动可算。
把“标注成本”换成“建模成本”——而建模正是飞速的本体工程主场。
INNOVATION 02
传统做法:训练完再拿合规检查卡一遍,不合规就丢回去重做。本平台:把 SHACL 形状编译成奖励项。
让策略在训练时就自动学会遵守约束,而不是事后拦截。
INNOVATION 03
概念漂移 → 扩充本体;关系漂移 → 本体修订;约束漂移 → 更新约束并重编译 Reward;分布漂移 → 告警 + 人审。
竞品更新的是上下文(喂给模型的事实),我们更新的是约束与奖励(模型被优化的目标)。
| 真值来源 | 来自哪个既有资产 | 可验证的领域 |
|---|---|---|
| 物理仿真真值 | 科学计算与物理建模(ScienceML) | 工程、航天、车辆、热管理——仿真器自己就是 reward oracle |
| 标准 / 法规条款 | 本体库 + 领域本体 | 医保、政务、审计 |
| 黄金集 | 站内 100 条(40 / 30 / 20 / 10) | 全领域 |
| 人工确认结论 | 企业上下文工程的「待决事项」队列 | 高不确定场景(人工确认后锁定,禁止模型覆盖) |
战略级洞察:科学计算与物理建模(ScienceML)这条业务线,给 AI 鉴证提供了一个稀缺品——可自动判对错的物理真值。这让飞速在工程 / 制造领域的 RLVR 闭环成本,远低于纯文本业务的同行。
对齐 Agent FlyTraining 三层架构(学习层 Algorithm · 数据层控制中枢 Store · 执行层 Runner),叠加七个鉴证模块。
| 层 | 鉴证增强模块 | 职责 |
|---|---|---|
| 学习层 | A1 鉴证引擎 | 置信度三维计算、A/B 对照分析、提升空间建模 |
| 学习层 | A2 进化引擎 | APO / VERL / SFT / RLVR 3.0 三层 Reward |
| 数据层 | D1 Trace & Evidence Store | 轨迹仓库 + 证据双链路图谱 |
| 数据层 | D2 Ontology & Shapes Registry | 领域本体 / 上下文本体 / SHACL 约束库 |
| 数据层 | D3 Drift & Reward Ledger | 漂移基线快照、奖励账本(可审计) |
| 数据层 | D4 鉴证控制台 | 鉴证任务编排、门禁、报告出具、A/B 看板 |
| 执行层 | R1 鉴证 Runner | OpenTelemetry 埋点 + 本体锚点注入 + 拒答前置门禁 |
01
没有锚点的输出不进入鉴证范围,直接标红。
02
本体版本 + 约束版本 + 轨迹 = 同一份报告。
03
不允许“编一个”,输出 Evidence Gap Report。
十项指标构成一张鉴证卡,每一项都有明确口径与采集方式。
| # | 指标 | 定义 | 基线 → 目标 | 采集方式 |
|---|---|---|---|---|
| 1 | 推理链路可还原率 | 能被本体锚定的推理步骤占比 | 30 → 90 | 本体反演四步法 |
| 2 | 结论可追溯率 | 结论可点回原始证据的比例 | 35 → 95 | Evidence Graph |
| 3 | 概念归位率 | 抽取实体成功对齐本体的比例 | 45 → 90 | 本体匹配 |
| 4 | SHACL 约束通过率(硬门槛) | 约束校验通过比例 | 60 → 100 | SHACL 引擎 |
| 5 | 本体覆盖度 | 推理链被本体覆盖的比例 | 40 → 90 | 鉴证引擎 |
| 6 | 证据支撑度 | 有证据支撑的推理边占比 | 30 → 90 | 鉴证引擎 |
| 7 | 漂移检出率 | onto_drift 正确识别漂移的比例 | — → 90 | 漂移监控 |
| 8 | 奖励—人工一致性 | 自动 Reward 与人工评判的相关性 | — → 0.85 | 抽样复核 |
| 9 | 拒答准确率 | 该拒答时拒答、不该拒答时不拒答 | 20 → 85 | 黄金集负例 / 例外 |
| 10 | 提升空间兑现率 | 增量鉴证预估 Δ 与实测 Δ 的偏差 | — → ≤20% | A/B 复核 |
所有指标口径沿用站内惯例:方案目标值,不代表已完成第三方复现。实际项目以实测为准。
三维均达标,SHACL 100%
发放 A3 鉴证徽章,放行进主流程
综合达标,但存在指定薄弱环节
发放 A2 徽章 + 整改清单(转抓手二)
存在硬约束违规或证据严重缺失
阻断上线
本体缺失过多,无法构成有效链路
输出缺口报告,转抓手二
收敛为一份《AI 鉴证报告》与一枚可复核的鉴证徽章。
| 交付物 | 形态 | 面向 | 频率 |
|---|---|---|---|
| 《AI 鉴证报告》 | PDF + 在线看板 | 业务负责人 / 合规 | 每次鉴证 |
| 置信度剖面图 | 交互式图谱(可点进任一环节看证据) | 算法与业务团队 | 每次鉴证 |
| 提升空间清单 | 带价签的表(Δ / 工作量 / 优先级) | 项目决策人 | 增量鉴证阶段 |
| 鉴证徽章 | 可嵌入客户系统的状态标识(A1 / A2 / A3) | 客户对外 | 持续 |
| 鉴证 API | REST / gRPC:attest(trace) → report | 客户工程系统 | 实时 |
| 持续鉴证订阅 | 漂移监控 + 定期复鉴 + 告警 | 生产环境 | 月度 / 季度 |
| 《RL 进化周报》 | 策略版本对比、奖励曲线、漂移事件 | 算法团队 | 周度 |
一次性
1–2 周
项目制
1–3 个月
订阅制
长期年费
鉴证平台把站内六项既有资产串成一条完整链路,不是新起一摊,是补齐最后一环。
| 既有资产 | 在鉴证平台中的角色 |
|---|---|
| 本体库 / 领域本体 | 提供概念、关系、SHACL 约束——鉴证的判据来源 |
| 企业上下文工程 | 提供证据链、时效与权限模型、「待决事项」人工确认队列——鉴证的证据来源 |
| 科学计算与物理建模(ScienceML) | 提供可自动判对错的物理真值——RLVR 的 reward oracle |
| OntoFlow 六工位 | 本体与约束的生产流水线——鉴证资产的制造工厂 |
| OntoBench | 12 领域 58+ 基准 + 六维目标——鉴证的横向基准 |
| FlyWork | 执行层 Runner——鉴证的采集与执行现场 |
OntoFlow 造本体 → 本体库存本体 → 企业上下文工程供上下文 → 科学计算与物理建模供真值 → AI 鉴证出证 → FlyWork 按证运行
| 维度 | 主流 Agent 平台 | 飞速 AI 鉴证平台 |
|---|---|---|
| 目标 | 让 Agent 跑起来、跑得顺 | 让 Agent 被信任、被审计、被复核 |
| 核心竞争力 | 模型 + 生态入口 + 数据汇聚 | 本体 + 约束 + 可复核的证据链 |
| 客户关系 | 我提供平台,你来用 | 我做第三方,给你出证 |
| 可迁移性 | 绑定其生态 | 中立:可鉴证任意厂商的 Agent |
| 失败时的输出 | 重试 / 换模型 | 定位断点 + 给缺口报告 + 给改进价签 |
出证 → 开方 + 进化 → 闭环运营。
验收:报告的每一条结论可点回证据。
验收:预估 Δ 与实测 Δ 偏差 ≤ 20%。
验收:连续 3 个月无人干预的漂移监控与自动修正运行记录。
把边界写在合同前面,才是真正的第三方姿态。
| 风险 / 边界 | 说明 | 对策 |
|---|---|---|
| 鉴证 ≠ 正确性担保 | 鉴证证明“推理链路可复核、约束被满足”,不等于结论在客观世界必然正确 | 报告中明确区分“链路可信度”与“事实正确性”,不合并成一个分 |
| 本体缺失即无法鉴证 | 本体覆盖度过低时,任何分数都无意义 | 直接输出「无法鉴证」+ 缺口报告,拒绝给一个好看的分 |
| 客户数据敏感 | 鉴证需读取轨迹与证据 | 支持私有化部署;本地脱敏后再出证;最小权限 |
| 既当运动员又当裁判 | 飞速自己也做本体与 Agent | 鉴证判据(本体 + SHACL 约束)公开可读、可被客户重算;关键场景引入第三方复核 |
| 对比竞品引发争议 | 涉及与 Agent 平台的定位差异 | 只讲方法论差异,不做性能断言;所有数据标注口径 |
| 指标无法自证 | 指标为方案目标值 | 严格沿用站内口径:方案目标值,不代表已完成第三方复现 |
| 漂移告警泛滥 | 误报导致团队忽视 | 分级告警 + 需人工确认后才触发重训,避免自动改坏生产 |
客户最常问的六个问题。
可以,而且这正是我们的定位。鉴证是中立能力:只要你的 Agent 能产生轨迹(LLM 调用、工具调用、检索),我们通过 OpenTelemetry Span 埋点接入,不需要你更换平台或改动核心代码。
模型的自评是概率,不可重算;我们的置信度是“本体覆盖度 × 证据支撑度 × 约束满足度”三项确定量的乘积,每一项都能被第三方独立重算。这是鉴证与自评的分水岭。
直接输出「无法鉴证」+ 缺口报告,不给分。低覆盖度下的任何分数都没有意义,给一个好看的分是最坏的做法。缺口报告会直接转成抓手二的提升空间清单。
鉴证判据(本体 + SHACL 约束)对客户公开可读、可被客户自己重算;关键场景引入第三方复核。我们卖的不是“相信我们”,而是“你可以自己验一遍”。
这正是本体 Reward 要解决的问题。r_schema / r_shacl / r_evidence / r_truth 四项奖励全部自动可算,不需要人工标注——我们把“标注成本”换成了“建模成本”,而建模正是飞速的本体工程主场。
不是。所有指标口径沿用站内惯例标注:方案目标值,不代表已完成第三方复现。实际项目的基线、目标与提升幅度,均以该项目 A/B 实测为准。