Skip to content

Jev(TypeSafe System One Model)精读与机制映射(200-201):闭合输出空间 × 校准领地 × 快慢分工 - #1171

Merged
ThreeFish-AI merged 3 commits into
feature/1.x.xfrom
ThreeFish-AI/jev-guided-learn
Sep 24, 2026
Merged

ThreeFish-AI merged 3 commits into
feature/1.x.xfrom
ThreeFish-AI/jev-guided-learn

Conversation

@ThreeFish-AI

Copy link
Copy Markdown
Owner

概要

以 /guided-learn 导师式精读拆解 TypeSafe AI 的首个「System One Model」Jev(jev-1.13.0,闭源):不生成文字、只对预定义类型问题(noul 是非 / choice ≤255 选项 / score ≤10 级)输出带校准概率的决策。全套沉淀入 docs/research/agent-infra/。

交付物

  • 200 精读笔记
    • 「快递分拣中心」单射比喻剧场贯穿(脑暴-重聚遴选:40 候选 → 否决 16 → 决赛圈 4.70 分定锚);
    • 四大机制:M1 闭合输出空间(合法 ≠ 正确,0% 错误率是构造保证非实测)、M2 一次编码·分支隔离·选项读出(100 问内延迟近平坦 / 隔离探针 0.00 vs 0.90 / 跨问题无不变量 0.72+0.47=1.19)、M3 RLCD 校准(confidence 是 adapter 代码可证的固定公式;分布内 ECE≈0.03 → 分布外 0.107 → 强制不确定 0.246)、M4 快慢分工编排(evals 准确率 67.8% 仅第 4,但 $0.0004/0.4s;拆校准「省成本烧质量」);
    • 五条底层规律(正交分解:输出空间/计算形状/概率语义/分布边界/编排分工)+ 三个争议 + 厂商数字跨源口径冲突表(6 篇公众号对官方数字 7 处失真)+ 批判性边界 5 条;
    • 双 Agent 费曼考评实录(三维盲答 → 薄弱点诊断 → 三板斧补课 → 同构变式复考全绿)与用户自测 3 题。
  • 201 机制映射:16 条(✅4/🔶6/⏸6),锚点全部 grep -n 实测。最大真增量是**「闭合输出空间」纪律而非接入模型**:Claude Code 自动作答不校验答案属于选项、Judge/PlanReviewer 解析失败静默降 0 分、global_search「无相关信息」哨兵漏入 reduce;直接接入 Jev ⏸ 暂缓(官方自认 CJK 较弱 / 闭源 / 本仓模型类型枚举无位),触发条件=可自托管 + 中文校准经本仓数据验证(候选 kev/laya)。
  • 最小原型 jev_lab.py:纯标准库 399 行、确定性无随机,--selftest 十场景 + --break B1..B6 六次破坏性实验(拆隔离→暗号串线 / 拆闭合空间→越界标签 / 拆温度→自称错 0.7% 实际 12% / OOD 沿用旧温度→错 23.1% / 拆共享前缀→12.5×→1.0× / 互斥拆双 Noul→和 1.85 同时执行),实测日志回灌笔记。
  • archify 两相管线图(四件套入 mermaid 管线,validate 0/0 + visual-check 四视口通过):jev--one-pass-decision(推理相 dataflow)、jev--fast-slow-harness(编排相 workflow)。
  • 索引与登记:knowledge-map / research readme §五 / _category_ / mermaid README / CHANGELOG 同步;取证副产物 7 处漂移(3 个未注册 task key、auto_answer_model 死配置等)登记 ISSUE-198。

与 #1170 的编号协调

feature/1.x.x 已合入 Hermes 精读(agent-harness 190-191 + ISSUE-196/197),本 PR 将 Jev 精读从 190/191 重编号为 200-201、ISSUE-196 → ISSUE-198(编号纪律「新主题开新十位段」,跨目录同号双主题易混淆),全部交叉引用同步改号;另顺手修复 CHANGELOG 中一处指向已外置 to-video 仓的失效相对链接。

验证

  • uv run --no-project python docs/research/agent-infra/assets/jev_lab.py --selftest → SELFTEST PASSED ✔;B1–B6 各自产出可复现退化日志,笔记引用逐字比对一致;
  • 独立 Veracity 子 Agent 对 190/191 全部数字、证据分级、锚点、IEEE 引用与判定计数逐项核验(5 处材料性修正已回填,含 B4 账单方向订正);
  • pre-commit 全绿(含 series-consistency-check 规则 5 死链检查);两张 archify 图产物均 ≤ 1 MiB。

🤖 Generated with Claude Code

- 190 精读笔记:「快递分拣中心」单射比喻贯穿 M1-M4(闭合输出空间合法≠正确 / 一次编码·分支隔离·选项读出 / RLCD 校准与 confidence 固定公式 / 快慢分工编排);多源对账(官方文档与评测 + adapter 钉点 e1d4cc9 + Hume 逆向探针 + kev b8aa777 / laya 76361c8 开源复刻 + 三组第三方基准 + 6 篇公众号)逐级标注【一/二/三/四】证据分级;五条底层规律 + 三个争议 + 双 Agent 费曼对抗实录(含同构变式复考全绿)+ 厂商数字跨源口径冲突表
- 191 机制映射:16 条(✅4/🔶6/⏸6),最大真增量=「闭合输出空间」纪律而非接入模型(自动作答不校验选项成员 / Judge·PlanReviewer 解析失败静默降 0 分 / global_search「无相关信息」哨兵漏入 reduce);直接接入 Jev 暂缓于 CJK·闭源·模型类型三门槛
- 最小原型 assets/jev_lab.py(纯标准库 399 行,--selftest + B1-B6 六次破坏性实验,实测日志回灌笔记)
- archify 两相管线图入四件套:jev--one-pass-decision(dataflow)/ jev--fast-slow-harness(workflow),validate 0/0 + visual-check 四视口通过
- 索引同步:knowledge-map / research readme §五 / _category_ / mermaid README 登记;CHANGELOG Added;取证副产物 7 处漂移登记 ISSUE-196(3 个未注册 task key + auto_answer 死配置等);顺手修复 CHANGELOG 一处指向已外置 to-video 仓的失效相对链接

🤖 Generated with [Claude Code](https://github.com/claude), [CodeX](https://openai.com), [Gemini](https://github.com/apps/gemini-code-assist)
Co-Authored-By: Aurelius Huang<threefish.ai@gmail.com>
…190-191、ISSUE-198 让位 196/197);

- merge origin/feature/1.x.x(#1170 Hermes Agent 精读已占用 agent-harness 190-191 与 ISSUE-196/197)
- Jev 精读笔记/映射 190/191 → 200/201,全部交叉引用(知识索引、research readme、mermaid README、CHANGELOG、issue、.mmd 溯源头)同步改号;本仓编号纪律为「新主题开新十位段」,跨目录同号双主题易混淆故让位
- ISSUE-196 → ISSUE-198;CHANGELOG 双方 Added 条目并存

🤖 Generated with [Claude Code](https://github.com/claude), [CodeX](https://openai.com), [Gemini](https://github.com/apps/gemini-code-assist)
Co-Authored-By: Aurelius Huang<threefish.ai@gmail.com>
- 201 #8「190 §5 的原型实测」→「200 §5」:被引数据(自称错误率 0.7%/实际 12%)出自 200 §5 的 S8 输出,190 §5 是 Hermes 学习闭环章;
- ISSUE-198 两处「191 §D3/D4/D6」「191 §落地建议」→ 201:D 编号漂移表与落地建议汇总均在 Jev 映射(201),191 为 Hermes 映射;
- 200 §3 原型实景块补齐引文:S1 补第三条 422、S4/B2 省略处补「...」标记、B2 拆后 5 行完整引用(含陷阱单越界行),使 §10 表「5 单 3 单越界」可从引文验证;全部非省略行经与实际运行输出逐字比对命中。

🤖 Generated with [Claude Code](https://github.com/claude), [CodeX](https://openai.com), [Gemini](https://github.com/apps/gemini-code-assist)
Co-Authored-By: Aurelius Huang<threefish.ai@gmail.com>
@ThreeFish-AI
ThreeFish-AI merged commit fb56e7c into feature/1.x.x Sep 24, 2026
1 check passed
ThreeFish-AI added a commit that referenced this pull request Sep 24, 2026
…,PR diff 只保留视频增量);

# Conflicts:
#	docs/.agents/knowledge-map.md
#	docs/assets/mermaid/README.md
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant