一直都有新编程:不看代码,还算程序员吗?

image.png

大家不吵编程语言哪家强(天下第一)了,转而吵AI编程:

  • 生成一堆垃圾有什么用
  • 这质量不能上生产
  • 太贵不实用

哦,上面是旧版本,新版本是:

  • 必须人来审核
  • 性能不行
  • 离不开人

在后续某个版本,大家会去吵哪家模型最好(天下第一)。

为什么那么说呢?

历史上发生过了。

编程三重奏

今天,你能想象,还有“机器码大神”,主要用机器码写公司的编程项目吗?来一段:

8d 04 37
c3

“汇编器?娘炮才用。真正的程序员才不会浪费宝贵机器算力,让机器替自己做汇编。”

汉明码发明者,理查德·汉明在IBM餐厅,向一百人介绍一套符号汇编系统,只有一位有一点兴趣。

后来SAP出现,汉明觉得“老程序员”之中,对汇编感兴趣的,约1%;还觉得他们就在想上面那句话。

image.png

——《The Art of Doing Science and Engineering

下面这段汇编,相当于上面的机器码。

lea     eax, [rdi+rsi]
ret

retreturn ,这样解释,对没接触过汇编的程序员,应该也能立马看懂ret,但其他得懂一些硬件。

但对“AI一代程序员”,可能连return都不清楚。

FORTRAN 刚出现时,很多程序员觉得编译器生成的机器码不可能比人工汇编好。

而现在懂汇编的程序员,占比还有多少?

一个额外问题:现在懂汇编的人数,比当前少,还是多呢?

可能有人觉得,当年看不起FORTRAN的人没眼光。那倒是有缘由:当时“自动编程”确实性能不行,宣发过猛。

所有早期“自动编程”系统,会让机器的运行速度降低到原来的五分之一甚至十分之一……

程序员用过这些……于是普遍相信:不可能自动写出高效程序。

计算机社区没有认真对待“自动编程”,还有另一个原因:一些“倡导者”热衷于四处宣传,声称自己的“自动编程”系统都快成精了,能理解用户所诉所求;但仔细一看,这些系统往往不过是在处理一些事务性工作,而且结构复杂、例外繁多,既难用又低效。

——节选,译自John Backus The History of FORTRAN I, II, and III

1957 年,FORTRAN 团队公布一个实际案例:47 条 FORTRAN 语句编译成约 1000 条机器指令;开发者估计,如果改成人工手写机器代码,要花约三天,而程序运行速度不会有明显提升

image.png

选择你的程序员定义:

  • 纯用机器码
  • 至少用汇编
  • 至少用高级编程语言
  • 至少用Agent产出独有代码
  • 钝角

批评者正确,但只限于那个当下。

大模型对话框,是这一代的命令行。

“纯正AI程序员”,可能狂喜,但后文有他们的噩耗。

多年前,或许有人能骑着马车,赛跑赢过火车。但马终归要休息,而火车呼啸前进,头也不回。

如果说高级编程语言,就像这火车,那么Agent就像是飞机。

更新一层

大模型公司的宣发很夸张,个别自媒体吹得更夸张,天天震惊、炸裂、原子弹爆炸……弹药充足,不带停的。

现在,很多人对AI编程、AI办公持怀疑态度,这很正常。如果接触的AI又是豆女士,那就更正常啦。

大概去年十一月,“自动编程”基本成立。部分程序员开始纯AI编程,甚至懒于肉眼审核AI产出,不去看具体代码。网友争吵进入「AI产出必须人来审核」阶段。

等会儿?“自动编程”,好像挺耳熟。前面解决汇编问题的宣发,也用过啊?

话说,微软的Copilot(副驾驶),怎么还低一档呢?

image.png

大伙争的,是一条边界,每一代程序员,守的人机界限:

到底哪些事交给机器,哪些交给人类?谁负责跟机器沟通,让大家手上的机器更好用?

这条界限一直在波动,最近剧烈一些。

2026年7月左右,各家公司热情褪去,开始盘算引入大模型性价比,甚至有公司约谈大模型用量大的员工。

是泡沫要破了吗?经济上可能比较危险,但模型使用上,并没有回到「太贵不实用」的迹象。

而且,模型进步是实打实的。

大模型进步速度

不到四年前,ChatGPT公布。

语法检查器Grammarly跟翻译软件DeepL,这俩专用模型支撑的软件,需求不减反增——GPT有亮点、有竞争力,但当时不便宜,表现不稳定,居然会漏段!而这俩经常进对比名单,效果名列前茅,曝光量反而变大很多。

但没两年,专用模型就“泯于众模”,Grammarly主动选择加入GPT来优化产品。这两年才了解大模型的人,可能都没听过。

你看看大模型价格下降多快呢?

拿约两年半前的GPT 4o做个例子,它比GPT 5.6Luna贵很多、编程质量上差得多,用实际编程数据让AI简单换算一下,在假设产出质量等同的劣势条件下,Luna反而省97%(考虑输入缓存。)

image.png

2024年5月13日,OpenAI 发布 GPT-4o,2026年7月30日,OpenAI 将 GPT-5.6 Luna API 价格下调 80%

不到两年半。

这是“底层战力”,那“高级战力”呢?

去年11月,“自动编程”基本实现,一些开发者开始习惯不看代码。

2026年7月9日,GPT 5.6 Sol,能较好处理部分模糊要求,基本实现了如下开发循环:

开发循环v1.svg

2026年9月4号,GPT 6 Astra除了优化了“小试”跟“开发”,同时也开始能做一部分“确认”跟“验收”工作:

image.png

另外,流程图v1,原本是GPT Image 2.5生图,然后我让GPT 6 Pro转为一个流程图网页,于是能手动自行调整成v1.1——画矢量图,也可以用开发循环。

另外模型矢量图能力,远不止这样,比如下方左侧是参考图,右边是临摹的矢量图,不用工具描图的情况下,迭代了第7次:

image.png

现在,人还在循环之中。程序员还守着人机边界。

再往后,开发循环又会怎么变呢?如果“小试”跟“确认”、“开发”跟“验收”越来越近,会出现什么结果?


3D建模也开始程序化。面数密度不高的场景,输入只需包含相对准确的描述,就能“打印”出模型,以及配套简单动画。下面这个模型,有效输入是两张图,磕磕碰碰花了一小时,折合API约14美元。

再考虑套餐价。而以往一个月,两百美元套餐,能用出折合API价一万美元的效果。也就是折合订阅价,这个3D模型花费人民币两块钱以内。

现阶段有很多问题,很贵,但又怎样呢?

3D建模界,会迎来自己的”提示词工程“热潮。

image.png

六年前,马斯克(未收购推特版):

“从最初的 GPT 到 GPT-3,进步速度确实惊人。如果这种势头延续下去,GPT-5 或 GPT-6 可能会强到一种地步,让人分不清它和最聪明的人类,谁更厉害。”

“这只是我个人的看法,不代表我在为它背书。我两三年前就已经离开 OpenAI 了,现在基本算是一个中立的局外人。” ​​​

image.png

当通用模型接手专用模型

GPT 6 Astra是做3D模型最好的通用大模型。那么有没有图片转3D的专用模型呢?

我以前对比过几家,选了一家用,相比Astra,做人像,目前稳定不少、便宜一些……

有既视感吗?还记得前面说的文字专用模型吗?

image.png

现在GPT6建模,灵活但较贵(好像订阅价也没贵多少?)不稳定,人像特别差,但它正在把3D建模AI编程化,接受更广泛输入的同时,它还能接手专用模型后续任务:“我有了一个粗糙3D模型,然后呢?”也就是下图的情景,甚至后面怎么对接到具体游戏应用。

image.png

a061d34c01001226ccd7fb56d5f7a828.jpg

这将会大大拓展受众群。不然你看上面那辆车,对应专有模型输出结果,用起来会麻烦太多:

image.png

你再看看大模型的产出组织,整整齐齐:

image.png

另外,如果购买了现有3D模型,导致风格不统一的问题,也有望解决:

image.png

许多年前,马车或许比火车快,快一时半会,但火车滚滚向前,势不可挡。

分层与泄露

计算机世界是分层的。很多人会想,一层负责一类事情,上层可以什么也别管。

这种策略相当成功、方便。你看,就连网络也是分层的:

image.png

但可惜,底层也会出问题,“底层代码依赖”也会有缺陷,Cloudflare也可能线路瘫痪,AI服务会宕机……此时,上层自行兜底,或者全员休息。

有人把这种情况画成一类梗图:

image.png

我把这叫做「复杂度泄露」。上层没有完全干掉下层,甚至会有新方案、新公司去处理下层事务。

高级语言同样不可能消灭:

  • 编译器缺陷
  • CPU 问题
  • 操作系统内核问题
  • 数据库性能问题
  • 网络故障
  • ……

也就是说,就算掌握了高级编程语言,也要有一些计算机常识:CPU、内存、数据库、操作系统……

我见过Vibe Coding项目:

  • 用Base64存图片。比如初版IMSB测评网页,每个人加载网页,都会把全部结果图片下载下来;
  • 用JSON或JSONL存大量数据。不知道为什么有的人特别喜欢这样存;
  • 写功能忘了检查,导致频繁读写磁盘。

别笑,大名鼎鼎的Codex,曾经频繁写磁盘,现在还在用JSONL存大量日志或聊天数据,里面有Base64存的图片。

image.png

这对“纯AI编程”来说是噩耗,但也有好消息:只要还有「复杂度泄露」,那么人始终会在「开发循环」中;只要AI还不能完美处理,那么就还需要人,守在人机之间。

AI编程,还有一层?

可能你会猜,更新的一层,是AI编程。

单位人类时间,输入能表达的空间越来越大:

  • 汇编码比机器码大;
  • 高级编程比汇编大;
  • AI编程比高级编程大;
  • ……

每加一层,人输入的麻烦越少,输入空间越大。

那再下一层呢?

回到之前的问题:

如果“小试”跟“确认”、“开发”跟“验收”越来越近,会出现什么结果?

你了解模型训练吗?训练的高频迭代,不可能手工进行,大家选择用训练集去自动确认、开发用测试集去自动验收。

凡是能低成本、反复且可靠地检验结果的任务,都能被训练。

训练产出大模型本身,一种新程序。

这一层程序员主要掌握的,应该是模型训练。标志是将AI编程基本覆盖住,并加以拓展。

或许是,「模型训练即开发,模型运行即编译」。开发的是模型这一新程序,编译的是高级编程语言这一“旧”程序。

「编译」成果也不只是程序,也有用户阅读的内容,图文音视频。

但是,也不是「但是」吧,或许是好消息:这可能要花很久时间,毕竟数据通路没那么好接。

AI编程还有时间。

而且,有「复杂度泄露」在,人类还有更多时间。

大模型:智能引擎

大模型缩短了信息的距离:

  • 人工搜索,换五六个关键词,点击十几个页面。问AI,一段话。
  • 想要一张图片,或许找实物拍照,或者请画师画个十天。问AI,两分钟。
  • 视频、模型、代码……

类比到物理空间,大模型是智能引擎,Agent是信息空间的飞机。

物理空间需要动力,信息空间需要智力。

飞机需要制造、维护;要配套机场、航道;需要准确定位、及格天气……

机场往往不是出发点,人类要花很多功夫在登机。

机场也不是目的地,人类还要自己折腾,最后一百公里。

但貌似,永远都有新火车、新飞机,一直都有最后一百公里。