全世界的 AI 公司,仿佛突然变成了编程公司
这两年,我越来越看不懂全球的 AI 局势了。
最开始,大模型带给人们的想象非常广阔。
我们曾经期待,AI 可以帮助人类获取知识、理解世界、辅助科研、改善教育、提高生产效率,甚至成为每个人身边长期陪伴的智能助手。
它应该更懂语言、更懂知识、更懂人的需求,也应该逐渐拥有处理复杂现实问题的能力。
但发展到今天,整个行业的方向却变得越来越单一。
无论是哪一家大模型公司,发布新模型时最喜欢强调的,几乎都是代码能力又提升了多少,在某个编程排行榜上又前进了多少,可以自动完成多少软件开发任务。
随后推出的产品,也大多围绕相似的方向展开:
- 自动阅读代码仓库;
- 自动修改代码;
- 自动执行终端命令;
- 自动修复程序错误;
- 自动完成软件开发任务;
- 自动充当程序员的编程智能体。
看久了以后,甚至会产生一种错觉:
全世界的大模型公司,好像突然集体变成了编程工具公司。
AI 原本拥有如此广阔的想象空间,最后却像是全部挤进了程序员的代码编辑器里。
这并不是说 AI 编程没有价值。
AI 确实可以提高开发效率,也确实能够帮助不懂编程的人完成一些过去无法完成的事情。
真正令人困惑的是,为什么几乎所有厂商都选择了同一个方向?为什么编程能力得到了压倒性的资源投入,而 AI 的其他能力却没有获得同等程度的重视?
更让人难以理解的是,在大模型疯狂卷编程的同时,部分面向普通用户的能力,不但没有明显进步,反而还出现了开倒车的现象。
AI 写作的倒退,只是其中一个例子
AI 写作就是最明显的例子之一,但它并不是唯一的问题。
早期的大模型虽然能力有限,却偶尔能够写出一些令人惊喜的文字。它的表达可能不够稳定,逻辑也未必严密,但有时会表现出一种自然的语感和意外的创造力。
现在的模型参数更大了,推理能力更强了,编程分数也越来越高,但写出来的文章却变得越来越相似。
开头一定要先制造一个问题,中间一定要分成几个小标题,结尾一定要进行价值升华。看起来结构完整、逻辑清晰,实际上充满了模板化表达。
它可以写得很正确,却很难写得真正动人;可以模仿某种风格,却很难形成属于自己的气质;可以在几秒钟内生成数千字,却经常没有一句话能够让人记住。
但写作能力的退化,只是普通用户能够直观感受到的一个切面。
类似的问题还出现在很多地方。
AI 依然会一本正经地编造并不存在的信息;面对复杂问题时,依然可能给出看似合理、实际错误的结论;它可以记住一次对话中的大量文字,却很难真正形成稳定、长期、连续的个人记忆。
它能够总结一篇文章,却未必能够准确判断文章里的信息是否可靠;能够给出一套完整建议,却不一定真正理解用户身处的环境;能够快速回答大量问题,却常常无法意识到用户真正想解决的,可能根本不是表面上的那个问题。
在教育领域,AI 很容易直接给出答案,却未必能够判断一个学生究竟在哪个知识环节产生了误解。
在企业管理中,AI 可以整理会议纪要,却很难看出不同部门之间没有说出口的矛盾。
在知识服务中,AI 可以把已有资料重新组织得更加漂亮,却依然没有彻底解决事实可靠性、来源追踪和知识更新的问题。
在长期陪伴方面,AI 每一次对话都像表现得很了解用户,但换一个时间、换一个窗口,又可能重新变成一个陌生人。
这些能力并不是完全没有进步,只是与编程能力获得的投入和关注相比,它们的发展显得过于缓慢。某些模型为了追求安全、稳定、简洁和工具化,甚至牺牲了一部分原本更自然的表达能力与交流能力。
所以,真正的问题并不是“AI 写作为什么变差了”。
而是:
为什么当整个行业开始无脑卷编程以后,那些无法被排行榜简单衡量,却与绝大多数普通人密切相关的能力,反而被放到了次要位置?
为什么偏偏是编程?
大模型厂商集体选择编程,并不是因为编程代表了 AI 的全部未来,而是因为编程恰好符合当前这场商业竞争的所有需要。
首先,编程是少数能够被清晰衡量的智力工作。
一段代码能不能编译、程序能不能运行、测试能不能通过,通常都有相对明确的判断标准。
AI 写错了,可以根据错误信息继续修改;AI 写对了,也能立刻获得反馈。
整个过程可以形成一个非常完整的闭环:
生成代码、执行代码、发现错误、继续修改。
但很多其他能力很难这样衡量。
一篇文章有没有灵魂,无法通过单元测试判断;一次沟通是否真正理解了对方,也没有标准答案;一个教育方案是否适合某个具体学生,可能要经过很长时间才能看到结果。
资本市场需要明确的进步,产品发布需要好看的数字,技术团队也需要能够反复测试的指标。
于是,代码排行榜成为最方便的证明方式。
只要新模型在编程测试中提高几个百分点,厂商就可以宣布模型能力取得重大突破。至于它是否更加理解普通人的真实需求,是否减少了错误信息,是否拥有更稳定的记忆,是否真正改善了人类获取知识的方式,这些问题因为难以量化,反而很少成为发布会的重点。
其次,程序员是最容易接受 AI 的一批用户。
程序员本身熟悉新技术,拥有明确的使用场景,也更愿意为提高效率付费。对于急于寻找收入来源的大模型公司来说,开发者自然成为最容易转化的一批客户。
更重要的是,代码是控制数字世界的语言。
如果 AI 能够编写代码、调用接口、执行命令,它就不再只是一个回答问题的聊天机器人,而有可能真正操作软件、处理文件、部署服务和完成任务。
因此,大模型公司真正看中的,可能不只是“帮助程序员写代码”这一个市场,而是希望通过编程能力进入整个数字化工作体系。
从商业角度看,这套逻辑完全可以理解。
但问题也恰恰出在这里:
最容易衡量的能力,不一定是最重要的能力;最容易商业化的方向,也不一定代表人工智能真正应该前往的方向。
几千万开发者,真的撑得起所有 AI 巨头吗?
即使把全球开发者按照三千万人粗略估算,AI 编程工具所面对的直接市场,可能也就是每年数百亿美元的量级。
这个市场当然不小,但现在几乎所有主流大模型公司都在争夺它。
更值得注意的是,AI 并不是传统软件。
传统软件开发完成以后,可以被大量复制。增加一个用户,通常不会带来太高的额外成本,因此软件卖得越多,往往越容易获得利润。
大模型却完全不同。
每一次生成代码、分析项目、运行智能体,都需要消耗真实的算力。任务越复杂,上下文越长,模型连续工作的时间越久,需要支付的推理成本就越高。
一名程序员让 AI 阅读几十万个文件、反复修改代码、执行测试,看起来只是在点击一个按钮,背后却可能有大量计算资源正在持续运行。
换句话说:
AI 公司并不是把一套已经完成的软件复制给用户,而是在用户每次使用时,都要重新启动一座微型计算工厂。
芯片需要成本,数据中心需要成本,电力需要成本,模型训练和持续更新同样需要成本。
这也是 AI 商业模式与传统软件最大的区别之一。
对于传统软件来说,用户使用得越多,企业越高兴;对于大模型来说,如果定价不合理,一个用户使用得越多,平台甚至可能亏得越多。
在这种情况下,全球所有大模型公司却依然同时挤进编程市场,不断降价、增加额度、提高模型调用上限。
大家共同瓜分的,可能只是一个并没有想象中那么巨大的市场;大家需要承担的,却是极其高昂而且持续存在的算力成本。
如果 AI 编程只是厂商进入更大市场的第一步,那么这场竞争还有解释空间。
但如果 AI 最终只是成为程序员的高级辅助工具,那么今天整个行业投入的资金、芯片和能源,能不能得到足够合理的回报,确实值得怀疑。
程序员每天最主要的工作,并不是写代码
AI 编程还有一个经常被忽视的问题:
程序员并不是一台只负责输出代码的机器。
在真正的企业环境中,很多程序员每天最耗费时间的工作,根本不是编码。
他们要参加需求会议,要理解业务部门模糊甚至互相矛盾的表达,要讨论技术方案,要进行代码评审,还要处理跨部门沟通、线上故障和不断变化的项目优先级。
很多功能真正困难的部分,不是怎样把代码写出来,而是所有人能不能先说清楚究竟要做什么。
AI 可以在几分钟内生成数千行代码,却很难解决不同部门之间的利益冲突;可以给出十套技术方案,却不能替企业决定愿意承担哪一种风险;可以自动修复一个程序错误,却无法回答系统发生事故以后究竟应该由谁负责。
即使 AI 把编码效率提高了数倍,也不意味着一名程序员的整体工作效率能够同步提高数倍。
因为编码完成以后,代码依然需要测试、审查、部署和维护。
甚至可能出现一种相反的情况:因为代码生成变得太容易,企业开始生产更多代码。
更多的代码意味着更多的依赖、更多的安全风险、更复杂的系统,以及未来更高的维护成本。
代码的生产成本下降了,并不意味着软件工程的总成本也会按照同样的比例下降。
因此,AI 可能减少一部分重复性的开发岗位,也可能改变程序员的工作方式,但企业很难因此裁掉所有程序员。
未来的程序员可能不再需要亲手编写每一行代码,但仍然需要理解业务、设计系统、判断风险,并对最终结果负责。
AI 可以替人生成代码,却无法轻易替人承担责任。
会写更多代码,不代表 AI 正在突破人类知识
今天的大模型,无论表现得多么聪明,本质上仍然主要依赖人类已经生产出来的知识进行训练。
它们可以总结、模仿、重组和推理,也可以从现有知识中发现一些人类不容易察觉的联系。
但如果没有新的观察、新的实验和来自现实世界的持续反馈,仅仅依靠已有资料,模型很难完成真正意义上的自我突破。
它可以生成一段从未出现过的代码,却不代表它创造了新的知识。
它可以提出一个看起来新颖的观点,却不代表这个观点经过了现实验证。
它可以模仿科学家的表达方式,却不等于真正完成了一次科学发现。
真正的知识突破,需要提出假设,需要进行实验,也需要面对失败和不确定性。
如果 AI 始终停留在语言、代码和已有数据库中,那么它更像一个读完了整座图书馆,却从未真正走出图书馆的人。
它知道人类曾经怎样描述世界,却没有亲自观察世界;可以计算大量可能性,却不需要为任何结论承担后果。
而现在,整个行业还在继续把大量资源投入代码能力。
这确实能够让 AI 更擅长操作数字系统,却不一定能够帮助它建立真正理解现实世界的能力。
如果大模型只是不断学习怎样调用更多工具、生成更多代码、完成更多软件任务,那么它可能会成为一个极其强大的数字执行者,却未必能够成为真正意义上的通用智能。
会操作计算机,与理解世界,并不是同一件事。
AI 真正应该卷的,远远不只是编程
AI 的未来不应该只存在于代码编辑器里。
它还应该拥有更可靠的知识能力,能够明确告诉人类哪些内容是事实、哪些内容只是推测,并且为重要结论提供可以追踪的来源。
它应该拥有真正稳定的长期记忆,不是每次打开一个新窗口都重新认识用户,而是能够在用户允许的前提下,长期理解一个人的习惯、经历和目标。
它应该更加理解人的真实意图,而不只是按照字面机械地执行命令。
它应该进入科研、医疗、教育、制造和能源等领域,与真实世界形成反馈闭环,帮助人类完成新的实验、获得新的数据,并创造过去不存在的知识。
它还应该帮助企业解决那些比写代码更加困难的问题。
如果程序员每天大量时间都消耗在会议、沟通和需求变更中,那么真正有价值的 AI,不应该只负责完成最后的编码。
它应该能够整理企业长期混乱的知识,发现需求中的矛盾,记录每一次决策的来龙去脉,并帮助不同部门准确理解彼此。
它应该减少编码之前无休止的误解,而不是在误解尚未解决时,更快地生成大量代码。
同样,在写作领域,AI 不应该只会生产结构标准的文字,而应该更加理解作者的观点、经历和情绪,帮助一个人保留自己的表达,而不是把所有人的文字都修改成相同的模板。
AI 写作只是一个例子。
真正需要被重视的,是那些与普通人生活、学习、工作和创造密切相关,却因为难以量化而被行业忽略的能力。
写在最后
为什么现在几乎所有 AI 大模型都在无脑卷编程?
并不是因为编程代表了人工智能的全部未来。
而是因为编程最容易测试、最容易排名、最容易展示进步,也最容易在短期内找到愿意付费的用户。
代码可以运行,结果可以验证,排行榜可以比较,商业故事也更容易讲清楚。
于是,整个行业开始把“最容易衡量的能力”,当成了“最值得发展的能力”。
这才是我真正担心的地方。
当所有大模型公司都追逐相同的排行榜、相同的客户和相同的产品方向时,AI 的道路也会变得越来越狭窄。
模型的编程分数不断提高,却依然会编造事实;能够自动修改整个代码仓库,却无法长期记住一个用户;可以调用几十种工具,却不一定真正理解人类为什么要完成这件事。
如果有一天,AI 可以独立开发一个复杂的软件系统,却仍然写不出自然的文字,理解不了人的真实情绪,也无法产生经过现实验证的新知识,那么我们真的能说它正在接近通用人工智能吗?
还是说,我们只是制造出了一个无比强大、无比昂贵的编程工具?
我不否认 AI 编程的价值,也不反对大模型继续提高代码能力。
我真正无法理解的是,为什么整个行业仿佛只剩下了这一条道路。
人工智能本来应该帮助人类理解世界、拓展知识、改善生活,并进入过去无法抵达的领域。它不应该只是让程序员更快地生成代码,更不应该为了几个编程排行榜上的分数,牺牲那些更加广阔、更加困难,也更加接近人类真实需求的能力。
编程可以是 AI 进入数字世界的入口,但绝不应该成为 AI 的全部未来。
如果下一代模型最大的进步,依然只是在某个编程排行榜上提高了几个百分点,那么也许并不是 AI 正在加速走向未来。
而是整个行业都在一条最容易打分的道路上越跑越快,却渐渐忘记了自己为什么出发。

