2 我终于能用 GPT-6 了!实测一波,Codex 要杀疯了? 550

邱宇2026-09-171214 阅读💛 48 收藏

我终于能用 GPT-6 了!实测一波,Codex 要杀疯了?

大家好,我是程序员鱼皮。

前几天 OpenAI 发布了 GPT-6 Astra,号称全世界最智能的模型,主打像人一样操作电脑和自主完成编程任务。

我看了一圈官方展示的案例,3D 城市生成、3D 卡丁车赛车游戏等等,效果确实震撼。

官方展示的 3D 卡丁车游戏

当时我就想第一时间跑轮实测,结果打开 Codex 一看,没有 Astra 的选项。

我以为是自己账号的问题,又专门买了个新账号,结果还是没有!

唉,只能「望模兴叹」了……

现在,我的 Codex 终于有 GPT-6 Astra 的权限了,赶紧搞几个实战项目测测看。

这次我选择了 4 个案例,由浅入深:

  1. 3D 程序化城市生成器(对标官方 Showcase,纯前端)
  2. 3D 奥德赛战争视频动画(前端 + 后端,专业运镜)
  3. 全栈 AI 编程工具(复杂长程全栈任务,跟 Fable 5.1 横评对比)
  4. 操作 KiCad 完成电路板布线(Computer Use)

点个收藏,咱们开始~

1、3D 程序化城市生成器

OpenAI 官方的开发者展示馆里有一个用 GPT-5.5 做的程序化城市生成器,编辑器风格的界面加上实时 3D 渲染。我想看看 Astra 能不能做到更好的水平。

官方的城市生成器

提示词里我就强调了一件事,至少包含重庆、上海、西安、深圳、江南五种城市风格,要让用户一眼就能认出是哪座城市。

之所以选重庆当主打风格,是因为层叠立交的复杂地形在国内辨识度极高,最容易看出 AI 到底有没有理解城市特色。此外,参数维度和编辑器布局怎么设计我一个字都没提,让 AI 自己去搜官方那版的产品设计,在此基础上做中国版。

Case 1 提示词

AI 拿到任务后,先用 Firecrawl 搜索了官方 Showcase 的产品设计,又查了 Three.js 的文档,然后一口气把整个项目写完了。

过了大约 18 分钟,7 项自动化测试全部通过,前端项目构建成功。

来看看成品,第一眼就被惊艳到了……

重庆 · 8D 魔幻山城

网站右侧是完整的城市生成器控制面板,城市风格、城市形态、建筑密度、平均高度、地形与交通、光照氛围全都能调。你随便拖动一个滑块,3D 场景就会实时重新生成。底部是五种城市风格的预览卡片,一目了然。

重庆的 3D 场景确实做出了高差感,建筑群层叠在地形的起伏上,标注了立交层数和轨道交通的位置。

再看看切换其他城市风格的效果。上海版是滨江平地加超高层密集,色调完全变了,标注了东方明珠和上海中心。

上海 · 陆家嘴天际线

西安版的特色也很鲜明,城墙围合结构、中式屋顶、低矮建筑群,整个色调偏暖土色,标注了大雁塔和钟楼中轴。

西安 · 千年长安城

深圳版切换到了暗色调,超高密度的玻璃幕墙建筑群,标注了深圳湾,赛博感十足。还能看到道路上的小车,很细节。

深圳 · 赛博未来都市

江南版的画风跟前四个完全不同,白墙黛瓦、小桥流水、低层建筑,水系穿城而过。

江南 · 枕水人家

这五种风格切出来视觉差异非常明显,不是简单换个颜色,建筑形态、地形高差、地标标注全都跟着变了。

这个完成度已经超出我的预期了。只用一段提示词,AI 运行 18 分钟就完成了开发和校验。之前用 Claude Fable 5.1 做同等复杂度的项目基本上要半小时起步,Astra 快了不少。

2、3D 奥德赛战争视频动画

第二个案例难度拉高。我让 AI 做一个 3D 史诗级战争场面的视频动画,主题是古希腊奥德赛的特洛伊战争,而且这是一个前端 + 后端的全栈项目。

这个案例最核心的考点是运镜。我要求整段动画要体现专业的运镜手法,不同段落用不同类型的镜头,镜头之间的转场要自然,战场上要有大规模的士兵群体。具体怎么实现、后端承担什么职责,全部交给 AI 自己设计。

Case 2 提示词

AI 先搜了特洛伊战争的经典场面和电影运镜手法,然后自己设计了一套前后端架构。前端用 Three.js 做 3D 场景渲染和镜头动画,后端用 Node.js 提供两个接口,一个根据场景配置生成分镜脚本,另一个调用 ffmpeg 把前端渲染的帧序列编码成 MP4 视频。

大约 19 分钟后,AI 交卷了:

特洛伊之围 · 开场

打开网页,一整片黄昏色调的战场直接扑面而来,大规模的士兵方阵、城墙城门、远处的战舰群都在。底部有完整的时间轴播放器,可以拖拽进度、调倍速、全屏播放,右上角还有「导出影片」按钮,对接的就是后端的 ffmpeg 导出接口。

特洛伊之围 · 战争推进

动画播放过程中,镜头确实在持续运动,从远景推向近景,能看到摄像机角度在截图之间有明显变化。

特洛伊之围 · 镜头推进

整段动画分成了六个章节,72 秒完整叙事,从风暴将至的全景一步步推到近距离搏杀,最后拉远收束。镜头轨迹的加速度都做了连续性处理,章节字幕是渐隐渐现的。

特洛伊之围 · 六个章节

过程中,AI 在自验证阶段发现了远景雾气太重、角色脚底悬空等几个问题,自己修了两轮,最后跑了 9 项测试全部通过。

不过也有明显的瑕疵,有几处角色穿模,士兵的武器偶尔会穿过身体,这种问题让 AI 再跑一轮修复大概率能搞定。

特洛伊之围 · 穿模问题

整体来看,这个项目从产品设计到技术实现都很完整。虽然 3D 模型本身是低多边形风格的,不是很精细的建模,但考虑到这是一段提示词从零做出来的全栈项目,已经很强了。

3、全栈 AI 编程工具 - 复刻 Cursor

这是我经常用的一个测试案例,让 AI 复刻一个像 Cursor 那样的 AI 编程工具。提示词跟之前测 Claude Fable 5.1、Kimi K3、DeepSeek V4 Pro 时用的 完全一样,好跟这些模型横向对比。

简单来说,我要求 AI 先克隆 VS Code 的开源代码,然后在此基础上做一个支持 Editor Window 和 Agents Window 双窗口切换的 Web AI 编程工具。Editor Window 负责代码编辑,Agents Window 负责 AI 对话和自主开发,技术栈让 AI 自由发挥。

Case 3 提示词

AI 拿到任务后同时做了两件事,一边用 Firecrawl 搜索 Cursor 3 的产品设计,一边通过 Git 命令克隆 VS Code 仓库。

然后花了大约 23 分钟,完成了第一轮开发。

有意思的是,AI 没有直接把产品叫做「Cursor 复刻版」,而是自己取了个产品名叫「orbit」,顶部中间就是 Editor / Agents 双窗口切换按钮。

先来看看 Editor Window 编辑器模式的效果:

整体布局参考了 VS Code,比如左侧文件树、中间 Monaco 编辑器、上方多标签页和面包屑导航、下方终端面板、右侧 Agent 对话面板。但又跟 VS Code 不完全一样,比如暗色主题配色、活动栏图标、状态栏信息这些细节都做了自己的设计,更像是一个独立产品而不是简单的换皮。

切换到 Agents Window,这就是我们熟悉的 AI 对话界面了:

Agents Window

Agents 面板有完整的任务管理能力,中间是对话输入区,下方已经配好了 deepseek-v4-pro 模型选择和 Agent 模式。

AI 能够正常完成简单的开发任务,核心功能都能跑通:

跟之前我测试过的几个模型横向对比一下。

Kimi K3 那次花了半个多小时,核心功能跑通了,但是界面比较简陋。

Kimi K3 的复刻 Cursor

再来看看 Claude Opus 5 用同样的提示词做出来的版本,代码高亮、小地图、管理面板都在,还原度很高,但说实话跟 VS Code 太像了,少了点自己的想法。

Claude Opus 5 的复刻 Cursor

Claude Fable 5.1 的完成度最高,有完整终端、Agent 执行流程和文件审阅机制,还能逐文件接受或拒绝 AI 改动。

Claude Fable 5.1 的复刻 Cursor

GPT-6 Astra 这次最让我惊喜的是它有自己的产品想法。没有完全照着 Cursor 去抄,而是自己设计了 orbit 这个品牌、自己加了任务分类管理和三个快捷入口、自己定义了暗色主题的配色体系。在 Editor Window 的视觉还原度上也做到了几个模型里最好的。

不过整个编辑器的功能丰富度还差 Fable 5.1 一截,像逐文件审阅改动这种功能 Astra 是没有做出来的。

4、操作 KiCad 完成电路板布线

前面三个案例测的都是 AI 写代码的能力,但 GPT-6 Astra 这次主打的其实是「操作电脑」。官方称它是全世界最强的电脑操作模型,ScreenSpot-Pro 的屏幕理解准确率从上一代的 76.9% 直接拉到了 92.7%。

官方的案例展示中,让 Astra 打开 KiCad 电路设计软件,把一张电子原理图变成可以直接拿去生产的 PCB 布线图,元器件怎么摆、铜线怎么走全部由 AI 自己完成。

官方演示:Astra 在 KiCad 里完成电路板布线

要知道,以前这玩意是硬件工程师一点一点手工拖出来的,是整个电子设计流程里最费时间的环节之一。

我想仿照这个案例自己试一试,于是在本机装了 KiCad 10,看看 Astra 能不能自己操作 KiCad 完成从原理图到 PCB 布线的全过程。

Case 4 提示词

这个案例跟前 3 个完全不同,AI 没有写代码,而是像人一样看屏幕、点按钮、拖拽元器件。

过了大约 13 分钟,AI 完成了任务。

它确实成功操控了 KiCad 的界面,打开项目、进入 PCB 编辑器、从原理图导入网表,这些流程操作都做对了。原理图一致性检查也通过了,说明 AI 看懂了原理图和 PCB 之间的对应关系。最后它还自己跑了一次 DRC 设计规则检查。

但是没能完成正确的布局和布线。我发现 AI 在画布上点击和框选元器件的时候,坐标经常对不准,没法可靠地把元器件拖到指定位置,更别说一根根地画铜线了。最终 DRC 报了 12 项违规和 20 处未连接。

这个结果让我挺失望的,因为我看了很多博主分享 Astra 操作 Blender 创造各种 3D 大作,成品都很惊艳,怎么到我这就翻车了呢?

从我自己的测试结果来看,Astra 在「看懂专业软件界面」和「找到正确的菜单按钮」这两件事上做得不错,但是却卡在了精细的画布交互上。这也侧面解释了为什么官方的 ScreenSpot-Pro 跑分能到 92.7%(看懂屏幕没问题),但 OSWorld 的任务完成率只有 72.6%(真正把活儿干完就难多了)。

我的感受

跑完这几个项目,我最直观的感受是:Astra 的前端审美和产品设计能力比 GPT 5 系列提升太多了!

以前大家测试 GPT 系列的模型,前端效果经常是被吐槽的点,而且 GPT 特别爱偷懒,功能能省就省,以快速完成为主。

比如之前我用 GPT-5.6 Sol 做出来的足球游戏界面是这样的:

GPT-5.6 Sol 的足球游戏

是的,那一坨黑色方块就是球门……

这次 GPT-6 Astra 的使用体感有明显变化,比如 3D 城市生成器那个项目不光功能做全了,连每座城市的地标标注都自己设计了一套,这种用心程度在以前的 GPT 身上是看不到的。

奥德赛战争那个项目也是,完整的 72 秒六章叙事、后端分镜脚本引擎加 ffmpeg 导出、连镜头轨迹的加速度连续性都做了处理。而且速度真的很快,几个项目 20 分钟左右就交卷了,比其他同级别模型快了将近三分之一。

但是我实测下来,感觉 Astra 消耗的 Codex 额度明显更快了,价格比之前贵了不少。基础的 Plus 账号跑 2 ~ 3 个项目就能把 5 小时额度耗光了,Computer Use 消耗更大,想长期用至少得开 Pro。

所以 Astra 到底值不值得用呢?

如果你做的是视觉要求高的前端项目,或者需要一次性交付的全栈产品,Astra 目前确实是第一梯队。

对于日常大多数的办公任务,没必要用这么贵的模型,国产的 Kimi、GLM 或者 DeepSeek 够用了。

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。

开源指路:

鱼皮的 AI 编程教程

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

也欢迎在评论区聊聊:你用 GPT-6 Astra 了么?觉得它是目前最强的模型吗?

AI
编程
程序员
AI编程
计算机
0个评论
全部评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
程序员鱼皮
程序员鱼皮
等级vip
内容推荐
更多
7. AI Coding 面试高分 Prompt 手册
2
8. 从零到一 AI Coding 面试高分 Prompt 手册
2
又一个新项目完结,全栈 AI 修图 Agent!
14
从玩具 Demo 到稳定交付:个人开发者的 3 条 AI 编程工程铁律
10
销售优先公司里,开发如何证明自己的价值
2
作者分享
更多
又一个新项目完结,全栈 AI 修图 Agent!
14
DeepSeek 官方竟然偷偷做了 Harness 桌面端,我已经用上了。。
11
耗时 6 年,我终于拿到 B 站 100 万粉丝奖牌!公布明年的秘密计划(
10
刚刚 DeepSeek V4.1 Flash 正式发布,竟然干掉了自家的 Pro 模型?!梁圣回归
7
GPT Images 2.5 首发实测,手绘成图、指哪改哪、也太逼真了!
10

文章评论(10

空向阳31 分钟前

整理得太全面了,省了我不少时间。

回复
拾贝者53 分钟前

实测过类似工具,作者说的基本属实。

回复
墨沐雨7 小时前

支持作者,持续关注中。

回复
龙文博14 分钟前

这个观点很中肯,深有同感。

回复
雪知秋14 分钟前

内容翔实,正好需要,先收藏再看。

回复
风倚栏58 分钟前

这个观点很中肯,深有同感。

回复
南山客55 分钟前

这篇文章分析得很透彻,收藏了!

回复
星寻梦54 分钟前

实测过类似工具,作者说的基本属实。

回复
墨沐雨50 分钟前

赞同,实践出真知。

回复
白向阳50 分钟前

有没有更详细的教程,期待后续。

回复