返回文章索引
TRANSMISSION / VIOLET8 MIN READ

从一封 GPT‑4 邀请邮件,到智能体时代

2023 年,我等来的是一次 8K context 的 API 访问资格;三年后,我们开始学习如何向智能体交代目标、权限、边界与验收标准。

#AI#GPT-4#智能体
一封来自 2023 年的邮件从玻璃时间胶囊延伸为现代智能体工作空间
三年前申请访问模型,三年后学习与模型共同工作

INTERACTIVE STORY / 16:9

从 GPT-4 邀请到智能体时代 · 六幕互动叙事

用 2 分 26 秒回看上下文、智能体工作流,以及能力与责任的变化。

2:26中文旁白 独立打开

点击画面底部“播放”开始旁白;支持拖动进度、分镜跳转、静音与旁白全文。

今天整理旧邮件时,我重新翻到了一封 2023 年 3 月 18 日的邮件。

邮件的标题很直接:

You’re invited to use the OpenAI GPT-4 API.

正文告诉我,已经可以通过 API 使用拥有 8K context 的 GPT‑4。

2023 年 GPT‑4 API 邀请邮件,正文说明可使用 8K context

那时 GPT‑4 才刚发布几天。API 需要申请、等待,再由 OpenAI 逐步邀请开发者。官方发布资料里,标准 GPT‑4 的上下文长度是 8,192 tokens,同时有限开放 32,768-token 版本。对当时的我来说,一次 API 访问资格本身,就像一扇刚刚推开的小门。

三年多以后再看,这封邮件已经不像一封产品通知,更像一枚时间胶囊。

数字变大,只是最容易看到的变化

早期开发者熟悉的是 4K、8K 量级的上下文。写提示词时,我们会计算还剩多少空间,主动裁剪资料,把长文拆成小段,再想办法让下一次请求接住上一次的结果。

到了 2026 年,百万级上下文已经进入主流前沿模型。OpenAI 当前模型目录列出的 GPT‑5.6 系列拥有约 1.05M context window;Google 的长上下文文档也说明,多款 Gemini 模型支持 1M 或更多 tokens。

从 4K、8K 到 1M 以上,上下文从短纸条延伸为多模态资料长廊

这不只是“能塞进更多文字”。代码、图片、音频、视频和大批文档可以共同成为一次任务的背景。以前必须先切碎、索引和摘要的资料,现在有更多机会被放进同一个工作上下文。

但更长的上下文不等于完美记忆,也不等于模型会自动抓住重点。资料越多,噪声、成本、延迟和错误关联也可能越多。真正重要的能力,仍然是选择什么信息、以什么顺序提供,以及如何验证模型是否理解了关键约束。

真正改变的是交互单位

三年前,我最常做的是“提问—回答”:

  1. 写一段提示词;
  2. 等待模型生成;
  3. 复制结果;
  4. 自己完成剩余工作。

今天,越来越多任务变成了“目标—上下文—行动—验证”:

  1. 说明最终目标与完成标准;
  2. 提供代码库、文档和当前状态;
  3. 允许模型调用搜索、文件、终端或其他工具;
  4. 让它执行一连串相互依赖的步骤;
  5. 用测试、构建、差异检查或人工评审确认结果。

聊天框扩展为包含文档、代码、浏览器、工具调用和人工确认的智能体工作流

OpenAI 当前的模型与 Responses API 文档已经把函数调用、网页搜索、文件搜索和计算机操作列为可用工具。模型不再只告诉我们“可以怎么做”,而是开始在获得授权的范围内参与真实工作过程。

这也是我认为“聊天模型”和“智能体”之间最重要的区别:前者交付一段内容,后者推进一个状态会变化的任务。

程序员的工作没有消失,而是向两端移动

当模型可以读代码、改文件、运行命令和检查结果时,程序员并不是突然变得不重要。相反,我们的注意力开始向任务的两端移动。

在行动之前,需要把问题定义得更清楚:

  • 目标是什么,什么不在范围内;
  • 哪些资料可信,哪些只是参考;
  • 哪些权限可以授予,哪些操作必须确认;
  • 失败时应该停止、重试,还是回滚。

在行动之后,需要把结果验证得更扎实:

  • 代码能否通过测试与构建;
  • 页面是否真的符合预期,而不只是生成成功;
  • 外部状态是否已经改变;
  • 结果能否被解释、复现和审计。

三年前,我们努力学习怎样写出一个更好的提示词。今天,我们还要学习怎样设计上下文、工具、权限、检查点和验收标准。

能力可以委托,责任不能外包

智能体越能执行真实操作,边界就越重要。

让模型总结一篇文章,与让它修改生产数据库,不是同一种授权;让它提出邮件草稿,与让它直接发送给客户,也不是同一种风险。一个成熟的智能体系统,不应该只追求“能做多少”,还应该明确:

  • 默认只读还是默认可写;
  • 哪些动作需要人在执行前确认;
  • 如何限制目标、目录、账号和数据范围;
  • 如何保存必要的操作记录;
  • 发生错误时怎样停止并恢复。

模型可以承担越来越多行动,但判断和责任并不会因此消失。最终仍然需要有人回答:为什么要这样做,依据是什么,风险由谁承担,结果是否可以接受。

再过三年,我们会怎样看今天

这封旧邮件如今很像一张偶然保存下来的车票。

2023 年,我申请的是一次访问模型的机会。2026 年,我们已经在学习如何让模型理解一个长期目标、使用工具、跨越多个步骤,并在人的监督下完成工作。

让我感慨的不是某一个参数增长了多少倍,而是时间被压缩了。许多曾经只存在于想象中的能力,没有在遥远的未来慢慢到来,而是在几次版本更新之间,悄悄变成了日常。

也许再过三年回头看,今天让我们惊叹的百万级上下文和智能体,也会像这封邮件一样,成为未来刚刚开始时留下的一件旧物。


资料说明

END OF SIGNAL
READER CHANNEL

留言

00
还没有留言。成为第一个发出回应的人。