两篇论文,先读到这里
2017 年《Attention Is All You Need》提出 Transformer,以注意力机制为核心处理序列。2020 年 GPT-3 论文展示了另一项重要能力:不更新模型参数,也能通过文本指令和少量示例完成多种任务。前一篇解释架构,后一篇展示上下文怎样成为任务接口。把两个节点分清,后面讨论提示才不容易混乱。它们是历史起点,当然不能包办今天所有模型的说明。
“帮我总结”还差一点
拿读书摘录举个例子,如果只说“帮我总结”,长短、取舍、格式都得让模型猜。我会多写几句:“把下面五条摘录按主题归类;每组用一句话概括;不要补充原文没有的事实;不确定的归属单独列出。”必要时再给一个例子。这些约束并不华丽,但能让结果更容易检查。这里利用的是当前输入,不能因为一轮对话很顺,就认定模型已经永久记住了偏好。
顺口这件事,先放一边
读答案时,我最想挑出的是那些说得过于顺口的句子。原文没提到的因果,它是不是自己补上了?一句“可能”,有没有在概括时变成“确定”?这些小地方,比排版是否漂亮更值得盯住。日期、引文和关键数字也要回原文确认。遇到那种特别肯定、却没给出处的句子,我会先在旁边留个问号。先不急着划掉,也先不拿去用。以上是我的阅读建议,不是论文给出的实验结果。语言流畅会影响第一印象,但要判断内容能不能用,还得逐项核验。