鼹鼠YANSHU · 验数

它是怎么工作的

分析内核 = InfiniSynapse Server API(先连 SSE 再 newTask);判定引擎 = 本服务内的确定性代码。 下面每个集成点都挂着真实任务 ID,可在平台后台查验日志。

核查链路

📄
材料上传
PDF/Word/PPT → taskUpload 归档到任务工作区
🔎
主张抽取
从材料抽出数字主张:数值 + 口径 + 时间范围
⛏️
联邦重算
DIRECT_QUERY 下推 MySQL × 读 Excel 底稿,聚合在数据库侧完成
⚖️
判定引擎
确定性代码:容差 1% / 口径唯一性 / 覆盖检查——❌ 只能从这里产生
📋
结论卡
✅/⚠️/❌ 三档,每条带 SQL 与口径出处

全程 SSE 直播(挖掘现场);事件持久化 task_events,断线快照恢复;口径卡经 saveToRag 固化知识库(裁决后异步回写)。

InfiniSynapse 集成点(真实任务 ID 可查验)

能力端点真实引用
长任务执行GET /api/ai/events → POST /api/ai/message (newTask)核查任务 c1ae1033-63af-457c-bbbf-87ef52f68ba3
AI 建档同上(建档任务模板)6880ef84-1b8d-42db-a04a-eb2f6553c13c(20.6 分钟 · 254 事件)
增量重验POST /api/ai/message (askResponse 追问原任务)实测 21–24s(本栈三连测)
口径知识库saveToRag / isSavedToRage25aad8f-0a94-42b1-9645-58f9d092c79a
数据源注册testConnection / add(凭据瞬时过境,不落库)MySQL(山丘业务库)+ 任务内 Excel 底稿
任务分享setShare / publicTask快照页「查看原始分析任务」证据链接

纯底稿模式

没有数据库也能核:把 Excel/CSV 底稿上传为真数源,鼹鼠把报告数字对着底稿逐条重算(报告 ↔ 底稿勾稽)。统计局、交易所、行业报告里的公开数据,自行下载整理成结构化表格后上传,即可作为核对基准。鼹鼠不代抓取公开数据、不背书其权威性——核对基准由你自备,结论只对「报告与底稿是否一致」负责。

为什么 ❌ 敢下结论(判定规则节选)

数值类
查询成功 且 覆盖完整 且 口径唯一命中 且 |重算−主张|÷重算 ≤ 1% → ✅;超容差 → ❌
排序类
榜单逐位比对全同 → ✅;任何一位不同 → ❌(附正确榜单)
⚠️ 的诚实语义
口径多卡命中 / 无口径定义 / 时间范围无法唯一解析 / 数据覆盖不足 / 查询失败——鼹鼠不猜,标 ⚠️ 并给证据;模型永远没有判 ❌ 的权力。
D1 · 口径双层设计
建档口径基线入 InfiniSynapse 知识库(saveToRag,共享只读);用户裁决存本服务 metric_cards.adjudications(工作区级 overlay,立即生效);核查任务注入"生效口径集"= overlay 覆盖基线的结果,不依赖 RAG 更新时效;固化为异步动作。

工程硬指标 N1–N8 · 实测值(如实标注,不做美化)

指标要求实测 / 说明状态
N1 单条增量重验< 15 秒实测 21–24 秒(本栈连续三次:23.6/21.2/23.0s);受平台负载影响波动,全程秒表直播波动 · 如实标注
N2 真实任务 ID平台后台可查日志建档/核查/重验/审单全部挂真实任务 ID(本页与工作台/快照页可见)达标
N3 ❌ 确定性判定零 LLMverdict-engine 纯函数(25 项全分支单测);全站无"可信度 %"合成评分达标
N4 数字/叙事分离已核实版 ≤30 秒13s;数字确定性渲染带出处徽章,叙述段标"AI 撰写 · 未核查"达标
N5 裁决历史追加式可查裁决两次历史两条(含回滚),口径卡页可见达标
N6 凭据不落库DB+日志双查仅注册时瞬时过境;本库只存平台数据源 ID + 脱敏 host达标
N7 真实任务主路径不摆拍演示核查/重验/裁决固化全部真实发起;预生成处(审单页/建档回放)均明示并挂真实任务 ID达标
N8 全量核查(12 条主张)≤ 90 秒实测 133–192 秒(本栈四轮:151/151/192/133s;耗时主要在平台侧模型推理)约 2 分钟 · 如实标注

所有计时为真实任务实测(非缓存回放);核查全程有 SSE 节点直播,可随时对照平台后台日志核对。