Keyboard shortcuts

Press ← or → to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

没报错只是开始——行为的可断言性

全书开篇问过一个问题:没报错,就代表输出没问题吗?界面部分第 24 篇把 ANSI 变成可断言的,回答了这个问题的一半——渲染层。但 agent 不只是会说话,它会做事:行为层的可断言性是另一个量级的难题。这一篇是本卷的地图:把“agent 评测“这团乱麻收拢成四个问题,后面每章认领一问。

待办(2026-10-07)· 执笔中:本章为全卷框架章,无对应博客篇,正文新写中;骨架与配图已定,先立章节地图于此。

本章将讲

  • agent 断言难在三件事:非确定性——同一输入不同输出,断言目标从结果移到路径覆盖与终态;成本是一等约束——每个样本都是真金白银;被测对象是复合体——模型 × 脚手架 × 工具 × 内容,归因必须靠对照。
  • 四问框架:能不能做对、坏了会不会察觉、是不是它的功劳、什么代价——也是本卷后六章的目录。
  • “什么代价“一问为什么暂不展开(线头留给 eval08)。