Stable Foundations · 06 / 06
AI 与评测
从“看起来不错”,到持续可用
认知地图可共创
核心判断AI 质量不靠一次灵感。先定义真实任务、合格证据和失败类型,再用反复评测推动持续改进。
一张图看懂先定义好,再持续测
- 01任务
- 02样本
- 03上下文
- 04生成
- 05检查
- 06反馈
- 07改进
五个核心判断流畅不代表可靠
输出带有不确定性
相同输入也可能得到不同结果,关键处要能复核。
影响决策何时必须人工看
上下文决定质量上限
事实给得不完整,模型也可能自信地答错。
影响决策需要提供什么
一次演示不是证据
一个漂亮答案不能说明同类任务都稳定。
影响决策能否正式使用
评测要贴近真实任务
通用分数不能代替用户是否真的完成了事情。
影响决策到底测什么
失败必须分类
说错、遗漏和啰嗦,需要不同的改进方式。
影响决策下一步改哪里
真实案例这批认知地图如何评测
已经知道
- 第一篇样板有明确内容骨架
- 你已确认它节省空间且可继续
- 其余页面沿用同一创作规则
当前认为
- 相同密度能适配其余基础主题
- 重复骨架会降低理解成本
- AI 加人工判断比独自写作更快
需要你体验
- 五篇内容是否准确且彼此不同
- 读完是否能形成明确判断
- 提示词是否能开启有用对话
三个取舍评测决定改进方向
寻找完美提示词→先建立一组小样本
先有尺子只看通用榜单→测试自己的真实任务
贴近使用评价语言是否流畅→评价是否帮助判断
核心标准AI 协作 · 最小评测
我要评测 AI 完成【任务】的质量。请先定义 3 个真实样本、合格标准和 4 类常见失败;再设计一张可重复记录结果的最小评测表,不要先优化提示词。
复制提示词