Stable Foundations · 06 / 06

AI 与评测

从“看起来不错”,到持续可用

认知地图可共创
核心判断

AI 质量不靠一次灵感。先定义真实任务、合格证据和失败类型,再用反复评测推动持续改进

一张图看懂先定义好,再持续测
  1. 01任务
  2. 02样本
  3. 03上下文
  4. 04生成
  5. 05检查
  6. 06反馈
  7. 07改进
评测不是给模型打总分,而是发现它在哪类真实任务上仍然不可靠。
五个核心判断流畅不代表可靠
01

输出带有不确定性

相同输入也可能得到不同结果,关键处要能复核。

影响决策何时必须人工看

02

上下文决定质量上限

事实给得不完整,模型也可能自信地答错。

影响决策需要提供什么

03

一次演示不是证据

一个漂亮答案不能说明同类任务都稳定。

影响决策能否正式使用

04

评测要贴近真实任务

通用分数不能代替用户是否真的完成了事情。

影响决策到底测什么

05

失败必须分类

说错、遗漏和啰嗦,需要不同的改进方式。

影响决策下一步改哪里

真实案例这批认知地图如何评测
事实

已经知道

  • 第一篇样板有明确内容骨架
  • 你已确认它节省空间且可继续
  • 其余页面沿用同一创作规则
假设

当前认为

  • 相同密度能适配其余基础主题
  • 重复骨架会降低理解成本
  • AI 加人工判断比独自写作更快
待验证

需要你体验

  • 五篇内容是否准确且彼此不同
  • 读完是否能形成明确判断
  • 提示词是否能开启有用对话
三个取舍评测决定改进方向
寻找完美提示词先建立一组小样本
先有尺子
只看通用榜单测试自己的真实任务
贴近使用
评价语言是否流畅评价是否帮助判断
核心标准
AI 协作 · 最小评测

我要评测 AI 完成【任务】的质量。请先定义 3 个真实样本、合格标准和 4 类常见失败;再设计一张可重复记录结果的最小评测表,不要先优化提示词。

复制提示词
下一轮从这里开始

对 super-context 的 AI 老师,你最不能接受哪一种失败:说错、说得太多,还是没有帮助你形成判断?