先注明,这是哪一年的样本
OpenAI 在 2024 年 5 月的 GPT-4o 介绍中,展示了跨文本、视觉和音频的端到端模型路线,并描述多种输入与输出模态。这份历史发布记录,适合用来理解任务信息怎样来自文字以外的形式。至于今天某个产品、接口或账户能用什么功能,需要查看对应的当前说明。演示视频很容易留下印象,所以我会特意把日期也放在旁边,避免把过去的发布内容误当成眼下的功能清单。
本节来源:Hello GPT-4o
海报上,字的大小也在说话
假设任务是阅读一张展览海报。只抄下文字,地点、时间和标题可能还在,字号、分组和视觉层级却丢了。我会把这个原创例题拆得更具体:提取文字、描述布局,再给出无障碍阅读顺序。输出中分开放“直接可见的信息”与“对版式的解释”。模糊的小字标成待确认就好,别猜一个看起来合理的日期。我有点在意这种细节:看不清的地方,就让那个问号留在那里。对读者来说,知道哪里还没看清,比得到一份表面完整的转录更有用。
到底要它看懂什么
读清日期、评价排版、辨认声音中的停顿,是不同的任务。我不太想用一句“理解正确”把它们混过去。以海报为例,可以分别核验文字、阅读顺序和遗漏项,再换不同尺寸、清晰度的图来测试。上传前还要检查有没有不必要的个人信息。多一种输入方式,应该减少完成任务的阻力;如果说不清它解决了什么,先不加也没关系。