侧边栏壁纸
博主头像
踏浪而行生活圈

行动起来,活在当下

  • 累计撰写 30 篇文章
  • 累计创建 21 个标签
  • 累计收到 0 条评论

目 录CONTENT

文章目录

GPT-6 发布后,我更确定 AI 的下一步是交付

朋友们好,这两天 GPT-6 Astra 刚发布,我把 OpenAI 的产品页、开发者文档、ChatGPT 发布说明和安全报告对了一遍。

看完以后,我最在意一个很实际的问题。我们交给 AI 的,到底还能不能只是一句话,还是已经可以是一整件工作?

先把名字理顺。OpenAI 在 2026 年 9 月 3 日发布的模型叫 GPT-6 Astra。网络上常说的“ChatGPT 6”只是习惯叫法。ChatGPT 是产品,GPT-6 Astra 是模型,也是 OpenAI 给 API 开发者使用的模型名称。ChatGPT 的普通聊天界面目前显示 GPT-6 Pro,ChatGPT Work 和 Codex 则开始使用 Astra。

截至 2026 年 9 月 5 日,GPT-6 Pro 正在向符合条件的 Pro、Business 和 Enterprise 用户推送。Plus 用户暂时不能在普通 Chat 中选择 GPT-6 Pro,不过可以在逐步开放的 ChatGPT Work 与 Codex 中用到 Astra。这个范围还在滚动变化,看到别人有入口、自己没有,并不奇怪。

名字和开放范围会继续变。GPT-6 留下的长期变化已经很清楚。AI 正在从回答引擎走向任务执行系统。

一条问题和一件工作的距离

以前用聊天机器人,我们习惯把工作切成很多小问题。

写报告时,先让 AI 列提纲,再找资料,再总结网页,再改语气。做表格时,你要把数据贴进去,解释每一列,再把公式复制回 Excel。写代码也差不多,AI 给出一段建议,你自己打开项目、改文件、跑测试、处理报错。

人负责串起整个流程,AI 只接住其中一句。

GPT-6 Astra 的设计目标向前走了一步。你可以交代一个目标,模型先理解任务,再制定计划,调用浏览器、代码、文件和电脑操作工具,随后生成文档、表格或演示稿。任务进行到一半,你还能补充要求,模型会保留已经完成的工作,调整后面的路线。

同一件事放到日常工作里,差别大致如下。

工作对话型 AI 常见做法Agent 型 AI 追求的结果
查资料给出搜索词和摘要打开来源、交叉核对、整理引用
做 Excel解释公式读取数据、写入公式、检查异常值并交付文件
做 PPT输出每页文案建立结构、生成页面、统一样式并按反馈修改
写代码提供代码片段进入项目、修改文件、运行测试并处理失败
行业研究回答一个问题连续完成检索、分析、写作和资料归档

这条变化让“会不会答”变成了“能不能交付”。模型需要记住长流程中的约束,知道什么时候用工具,遇到错误以后还要回头检查。一次漂亮回答很容易让人惊喜,完成十几步工作更考验稳定性。

从目标到交付的 Agent 工作流

一件完整工作会在执行、检查和修正之间来回几次。

Benchmark 开始靠近工作现场

发布新模型时,大家总会先看分数。GPT-6 Astra 的成绩确实很高。OpenAI 公布的对比里,它在专业知识工作、软件工程、浏览器任务和电脑操作上都超过 GPT-5.6 Sol。

GPT-6 Astra 与 GPT-5.6 Sol 的四项评测对比

图中数据来自 OpenAI 2026 年 9 月 3 日发布页。

这些数字值得看,不过它们只能证明模型在规定环境里完成某类任务的能力。真实工作会混进很多评测题里没有的东西。网页可能改版,文件命名很乱,数据口径会打架,老板会在做到一半时换要求,登录页面还可能突然弹出验证码。

所以我更愿意把 Benchmark 当成体检报告。它能告诉我们哪些能力进步了,不能替你保证明天交出去的文件一定正确。

GPT-6 最有说服力的几项提升,恰好都靠近实际操作。BrowserGym 从 GPT-5.6 Sol 的 51.5% 提高到 77.7%,OSWorld 从 61.8% 提高到 73.8%,SWE-Bench Pro 从 57.7% 提高到 61.3%。专业工作评测 GDPval 则从 55.6% 提高到 70.9%。

OpenAI 还给出一个容易被忽略的数据。在 GDPval 任务中,模型完成任务的平均速度约为人类专家的 9 倍,推理成本不到专家收入中位数的 1%。这是一项模拟评测,只算模型推理成本,也没有计入监督、返工、工具订阅和错误代价。它说明自动化的经济吸引力已经很强,离“可以把任何工作放心交出去”还有一段距离。

Agent 化把工具串成流程

Agent 这个词已经被讲得有些玄。放到 GPT-6 上,可以先按工作流程来理解。

聊天机器人等你继续提问。Agent 会根据目标判断下一步,决定该查网页、读文件、写代码,还是先向你确认一项会影响结果的信息。

GPT-6 Astra 支持网页搜索、文件搜索、代码执行、电脑操作、图片生成、MCP 和工具搜索。它还能调用外部函数,让你的应用去查数据库、发起审批或处理业务系统中的记录。模型负责判断和编排,工具负责接触真实世界。

能力列表本身没有多大意思。把它们连起来以后,工作方式才会变化。

例如你让它研究一家公司的新产品。模型可以先找到官网与文档,浏览页面,读取附件,写一个脚本整理数据,再把结论放进表格和演示稿。中间某个数字对不上,它需要返回来源继续核对。你补一句“只保留官方口径”,后面的分析还要跟着收紧。

这类连续动作要求模型在很长时间里守住任务边界。GPT-6 Astra 的 API 上下文窗口达到 105 万 token,最大输出为 12.8 万 token。窗口更大,让它能带着更多资料工作,也会带来更高费用和更复杂的上下文管理。想了解 token 与上下文的基本概念,可以先看站内这篇 AI Token 通俗解释

中途改要求,协作才像日常工作

过去的长任务有一个很烦的地方。模型一旦开始执行,你往往只能等它结束,再开下一轮修改。前面的工作能否保住,全看产品怎样处理上下文。

GPT-6 Astra 在 Responses API 中加入了 mid-turn steering。模型工作期间,应用可以通过 WebSocket 发来新指令。已经完成的内容会保留,模型根据新要求继续执行。

假设你让它做一份 AI 行业周报。做到一半,你发现读者是普通职场人,于是补充“删掉投资市场部分,多讲两项能在办公室直接用的工具”。接着又补一句“表格保留,PPT 改成十页以内”。

正常的同事会沿着已有材料改。一个可用的 Agent 也应该做到这一点。每次改一个要求都推倒重来,算不上协作,只是重复生成。

另一个变化是推理强度可以在同一段对话中调整。GPT-6 Astra 支持 low、medium、high、xhigh 和 max 五档 reasoning effort。开发者可以让模型在资料去重时用较低强度,碰到口径冲突或复杂代码时再提高强度,后续简单修改又调低,并继续利用已经缓存的上下文。

这里的 reasoning 可以理解为模型愿意为任务分配多少内部计算。它不等于人类的意识,也不能保证高档位一定正确。简单翻译开到 max,只会让等待和成本变多。五年财务数据、跨文件代码修改、长时间研究更可能从额外计算中受益。

用一份 AI 行业周报验收 GPT-6

我没有拿尚未普遍开放的账号编一段“实测经历”。更稳妥的做法,是把官方能力写成一份任何人拿到 Astra 后都能复现的验收任务。

可以把下面这段交给 ChatGPT Work、Codex,或者接入 GPT-6 Astra 的应用。

请制作一份面向普通职场人的 AI 行业周报。

时间范围限定为过去 7 天,只采用公司官网、官方博客和正式文档。
先列出候选信息和来源日期,由我确认选题后再继续。
最终交付一篇 1800 字以内的中文周报、一张信息汇总表和一份 10 页以内的演示稿。
每条事实保留来源链接,数字冲突时不要自行选一个,请列出差异并询问我。
执行期间只读取公开网页,不登录账号,不发送邮件,不发布内容。

这份任务把 GPT-6 的能力放进了一个完整流程。

第一段是搜索和阅读。模型要控制时间范围,打开来源,识别发布日期,排除重复稿和转述稿。它擅长扩大检索面,也容易被网页里的错误日期、隐藏指令和旧内容干扰。来源等级与时间边界需要写清楚。

第二段是判断信息价值。模型可以按读者、影响范围和可操作性给候选选题排序。它不知道你的账号过去发过什么,也未必理解读者对某个话题已经厌倦。站内搜索、选题记录和人的编辑判断仍然要进流程。

第三段是生成文章、表格和演示稿。GPT-6 发布页专门展示了电子表格、文档和幻灯片能力。它在 Investment Banking Spreadsheet Tasks 中得到 87.3%,图形化文档评测也明显超过 GPT-5.6 Sol。数字高,检查步骤依然不能省。公式引用、表格单位、分页、字体和图表轴都值得人工扫一遍。

第四段是中途修改。你可以让它缩短篇幅、调整受众、增加一项对比,同时保留已核验的来源和表格。mid-turn steering 让这件事在技术上更自然,产品端能否完整开放,要看具体套餐和应用界面。

第五段是交付。Agent 最容易在这里让人产生错觉。文件生成出来了,任务看着像结束了。编辑还要检查链接能否打开、日期有没有越界、图表与正文是否一致,随后决定保存、发送还是发布。

AI 在这条流程里承担了大量搜索、整理、计算和排版。人把住选题、事实口径、受众判断与最终发布。分工清楚,GPT-6 才能省时间。把“自行判断一切”写进提示词,省下来的几分钟可能会在返工时加倍还回来。

普通人的工作会先发生哪些变化

职场人最先感受到的变化,多半来自文件。你可以交给 AI 一份原始数据和会议记录,让它整理表格、写报告、做演示稿,再根据领导反馈继续改。人的时间会更多放在确认口径和选择表达方式上。

程序员会逐渐从逐行生成代码转向管理一段开发流程。任务要包含仓库边界、测试要求、不能修改的模块和验收条件。AI 能写得越多,代码审查、权限隔离和回滚准备越重要。

自媒体作者可以让 Agent 搜集来源、建立素材表、整理初稿和图片清单。选题价值、事实核验、作者立场与发布责任仍由人承担。产品经理也会把调研、需求草案、原型说明和数据分析串在一起,随后把时间留给冲突协调和取舍。

学生和研究人员能更快地检索、归类和生成初稿。引用是否准确、实验是否可复现、推论有没有越过证据边界,这些工作不能外包给模型。

未来更稀缺的能力,会落在任务定义上。你要说清目标、材料范围、交付格式、检查标准和禁止动作,还要知道在哪些节点看一眼。会问一句好问题仍然有用,会安排一整件工作更有价值。

能做事以后,权限成为产品核心

只生成文字的 AI 犯错,影响通常停留在对话框。能操作浏览器、文件、代码和业务系统的 Agent 一旦理解错对象,可能改错数据、发错消息,或者把敏感内容交给不该访问的工具。

OpenAI 给 GPT-6 Astra 配套的安全报告也把问题说得很直白。Astra 是 OpenAI 第一款按“网络安全关键能力”部署的通用模型,系统卡同时承认它在部分攻击场景下更会规避监控。OpenAI 因此加入了异步失配监控、权限分层、运行环境隔离和人工停止机制。

这些安全措施不只属于大公司。普通人使用 Agent 时也可以照着做。

人、AI 与控制机制的分工

目标和最终决定留在人手里,AI 负责执行,控制层限制它能触碰的范围。

先从只读任务开始。需要写入时,把读取和修改拆成两步。发送、删除、付款、公开发布和权限变更保留逐次确认。运行代码时使用沙箱,保留操作记录,并准备回滚方式。

Agent 越能干,权限设计越不能放在最后补。一个任务应该同时写清它要完成什么,以及它不能碰什么。

Prompt 会变成任务说明书

Prompt Engineering 不会消失,它会换一个重心。

过去我们研究怎样把问题问得更清楚。Agent 时代还要描述任务边界,安排工作顺序,定义交付物,并设置人工检查点。开发者常把这些工作称为 Task Engineering、Workflow Design 和 AI Delegation。

名字可以先放一边。实际写任务时,下面几件事最有用。

  • 写清目标和读者
  • 指定可以使用的资料与时间范围
  • 说明交付物的格式和数量
  • 给出验收条件
  • 标明禁止动作与必须确认的操作
  • 规定遇到冲突、缺失和失败时怎样处理

这比堆很多语气词有效。你正在给一位动作很快、知识很多、偶尔会自信出错的同事写任务单。要求越模糊,它越可能在你没有留意的地方替你作决定。

ChatGPT 和 API 面向两种人

普通用户接触 GPT-6,主要通过 ChatGPT Chat、ChatGPT Work 和 Codex。产品会替你准备界面、工具、权限提示与文件环境,能力范围受套餐、地区和管理员设置影响。

开发者通过 API 使用 gpt-6-astra,可以自己连接函数、MCP、数据库和业务系统。自由度更高,权限、日志、失败重试和成本控制也落到开发团队手里。工具调用需要 Responses API,Chat Completions 虽然支持模型本身,却不能用 Astra 的工具调用能力。

GPT-6 Astra 的标准 API 短上下文价格为每百万输入 token 10 美元、每百万输出 token 50 美元。超过 27.2 万输入 token 后,整次请求会按长上下文价格计算。它更适合高价值、长流程任务,日常分类、短摘要和批量简单处理可以交给更便宜的模型。

OpenAI 称 Astra 虽然单 token 更贵,但在多项任务中用更少输出 token 完成工作,单次任务的估算成本可能低于旧模型。这个结论仍需开发者拿自己的数据验证。模型省不省钱,要看任务成功率、返工次数、工具费用和人工审核时间。

我更愿意这样理解 GPT-6

用一句比喻来收住这次升级。

GPT-3 让更多人见识到机器会聊天。GPT-4 把理解复杂内容的能力向前推了一大步。GPT-5 强化了推理和工具使用。GPT-6 Astra 开始把这些能力串进一段持续执行的工作。

这不是严格的技术分代,只是帮助普通读者理解重心怎样移动。

GPT-6 还会犯错,也没有拿走人的责任。网页操作会失败,来源会冲突,表格公式会写错,代码可能通过局部测试却破坏别处。任务越重要,越需要人来定目标、看证据、做取舍并签下最终决定。

AI 会承担更多搜索、计算、分析、执行和整理。人要学会描述目标,设置边界,在关键节点判断方向。

人与 AI 的关系正在离开“我问一句,你答一句”。下一种更常见的对话,大概会是“我说明要完成什么,你把过程跑起来,我在该决定的地方接手”。

这才是 GPT-6 最值得继续观察的变化。

资料来源

0

评论区