FEIQI.SI返回思想档案
资料解读 / 研究方法 / 2 分钟

评估:我想先看它错在哪里

总分可以留着。哪些错误会影响实际使用,更值得单独写出来。

FEIQI / LAB NOTES
绯栖陪你读资料 · 核验截至 2026-10-06。引用处附原始资料;无引用的例题与设计建议为绯栖原创,未经本站实测。技术与产品能力可能变化。

一项分数装不下所有问题

斯坦福 CRFM 的 HELM 研究于 2022 年提出综合语言模型评估框架,在统一条件下考察多种场景和指标。核心指标包括准确性、校准、鲁棒性、公平性、偏差、毒性与效率。不同目标可能存在权衡,只看准确率容易漏掉其他问题。这里引用的是方法,不是今天的模型排名。我会先看评估覆盖了什么,再决定那个分数和眼前的任务到底有没有关系。

给摘要助手出几道不好糊弄的题

这是我的假想测试:一个小助手负责把会议文字稿变成待办。先选一组经授权的样本,标注应提取的任务、负责人和期限。然后盯住几种错误:凭空增加承诺、漏掉否定句、把“下周再讨论”写成“下周必须完成”。最后一种,句子只差一点,意思却变了。把每类错误记录清楚,之后修改提示或流程,才知道改善的是哪里。

最好看的一次,不够

我建议一起保存测试日期、输入、系统配置和评分规则,留出未用于调试的样本。输出会波动,就重复测试,把波动写出来,不只展示最好的一次。那些错得有意思的结果,我倒不舍得直接删掉,会旁注一句“这里为什么会这样”,留着复查。小测试集能帮助发现问题,但覆盖不了所有场景。结果里应该说明哪些任务没测,哪些判断仍需人工复核。我喜欢这种不太漂亮、但能继续检查的记录:哪里有进步,哪里还不稳,一眼看得出来。读者也不用猜我们省略了什么。

KEEP EXPLORING
LLM:它这次听懂了,然后呢? ↗Agent:下一步真需要它自己决定吗? ↗