停用 GPT 一个月后,我回来了

因为种种原因停用了一个月 ChatGPT,一直在试用国产产品。现在 GPT6 发布,是时候回来再看看差距到底在哪里。

1 / 1

停用 ChatGPT 差不多一个月了。

原因挺杂的。政策层面的不确定性是一方面,费用是一方面,另一方面国产的 Agent 和 Harness 产品确实越来越多、越来越能打了,我想认真试一试它们到底能到什么程度。于是干脆把 GPT 暂时放下了,全面切换到国产智能体加国产模型的组合。

这一个月下来,体验其实没有想象中那么痛苦。但现在 GPT6 发布,各种强大的作品展示效果层出不穷,恰逢我的国内免费积分也快用完了,是时候回来再看看了。

切换的过程比想象中顺利

先说结论:从 Codex + GPT5.5 切换到国产智能体 + 国产模型,并没有太多的不适应。

这一点我是真心觉得不错。

说实话,一年前如果让我做同样的切换,体验落差可能会非常明显。但现在,无论是豆包、Kimi 还是其他几家,在代码理解、多轮对话、上下文保持这些方面,确实已经做到了一个相当可用的水平。

尤其是在一些标准化的任务上——比如写一段业务逻辑、生成测试用例、做简单的代码审查——国产模型的表现已经相当稳定。我日常用 Codex 做的事情,换成国产智能体以后,大部分场景都能接住。

从这个角度说,中美 AI 的差距确实在缩小。 这不是客套话,而是过去一个月里我最真实的体感。

具体用了哪些产品

先列一下这一个月用过的东西。

智能体方面,试了一圈:CodeBuddy、WorkBuddy、Trae、Qoder、千问办公。用下来的感受,一言以蔽之——都差不多。 界面设计、交互逻辑、任务完成度,没有谁拉开谁一个身位的感觉。各有各的小毛病,也各有各的亮点,但整体体验高度趋同。

基座模型方面就杂一些了:GLM5.2、GLM5.3、GLM5.3 Flash、Kimi-K3、HY4 Preview、HY3、DeepseekV4 PRO、DeepseekV Flash、QWEN 3.8,能排上号的几乎都跑了一遍。

体感上,推理能力和深度没有想象的差距那么大。 大家在逻辑推理、代码理解、方案生成这些方面的表现,说实话已经非常接近了。倒是执行速度和积分消耗,确实让几个 Flash 模型优势巨大——同样一个任务,Flash 模型可能 10 秒出结果还不怎么耗积分,换一个满血版可能要 30 秒还烧掉好几倍的额度。对于日常高频使用来说,这个差距比模型能力本身的差距更直接影响体验。

但信心是另一回事

话说到这里,但后面还有一个"但是"。

切换过去以后,我发现自己有一个很明显的变化:对国产产品产出的信心不足。

这种信心不足不是说它们回答得不好,而是一种隐隐的担心——会不会哪里有比较大的理解偏差?会不会有一个看起来很合理但实际上是谬误的答案?会不会在某个关键细节上自以为正确但其实是错的?

于是我养成了一个习惯:同一个问题,用多个国产产品交叉验证。

A 产品给了一个答案,我再问一遍 B 产品;B 产品说了一个方案,我再让 C 产品看看有没有问题。表面上看这是在充分利用各家的长处,但实际上,这背后是一种不太敢完全信任的心态。

反过来说,我几乎从来没有对 GPT 产生过这种需要交叉验证的冲动。不是因为它一定不会犯错——它当然也会幻觉——而是长期以来建立的使用信任,让我在大多数场景下愿意直接采纳它的结果。

这种信任不是一天建立起来的,而是在无数次使用中慢慢积累的。每一次它准确理解了我的意图,每一次它给出了合理的方案,每一次它在复杂问题上表现出的稳定性,都在为这种信任充值。

而国产模型目前还处在这个信任充值的早期阶段。

为什么信心差距这么重要

可能有人会觉得,多验证几次也不是什么大事,不就是多花几分钟嘛。

但实际使用中,这种信心差距的影响比看起来要大得多。

当你对一个工具的产出不够信任时,你的使用方式就会发生根本性的变化。你会更保守,更不敢尝试,更倾向于把 AI 的输出当成"参考"而不是"半成品"。你会花更多时间在检查和验证上,而不是让它帮你往前推进。

更关键的是,你不太敢让 AI 深度参与复杂任务。因为一旦涉及多步骤、多文件、需要连贯理解的场景,任何一个环节的理解偏差,都可能像蝴蝶效应一样放大到最后的结果里。

这种谨慎在很多场景下是对的,但它同时也意味着你没有真正释放 AI 的能力。

现在回来,看看 GPT6 到底有多强

GPT6 发布这几天,我看了不少作品展示,确实有一些让人眼前一亮的效果。

但看别人演示和自己实际使用,始终是两回事。所以我不想在没有深度使用之前就下结论。这次回来,我想认真对比几个方面:

维度 国产智能体 + 国产模型 GPT6 + Codex
标准化任务 表现稳定,可用 预期会更强,但待验证
复杂理解 够用,偶尔有偏差 需要验证
多步推理 基本可用,信心不足 需要验证
代码生成 质量不错 预期会有提升
使用成本 有免费额度,但开始收费 Plus 订阅 + API 按量
信任感 需要交叉验证 长期积累,相对更高

这个表格里的"待验证"不是我偷懒不想写,而是我真的觉得,在没有足够使用数据之前,给任何一个方向下结论都为时过早。

说说费用这件事

既然提到了费用,就多说两句。

国产产品的免费积分确实是我这一个月能全面切换的一个重要支撑。但正如前面说的,免费积分总有用完的时候,而一旦开始付费,价格差距就变得很现实了。

GPT Plus 每月 20 美元,这个价格虽然不便宜,但考虑到它能提供的能力上限和稳定性,对于把 AI 当成核心生产力工具的人来说,是一笔算得过来的账。

国产产品目前的定价策略还在探索阶段。有的免费额度给得很大方,有的已经开始收紧。这种不确定性本身也会增加使用时的心理负担——你不知道下个月还能不能像现在这样用。

最后

停用一个月 GPT,最大的收获不是发现国产产品已经能完全替代了,而是让我更清楚地看到了差距到底缩小了多少,以及剩下的差距到底在哪里。

国产模型在标准化任务上的表现已经相当不错,这是事实。但在需要深度信任、复杂推理和长期稳定性的场景下,要追上的路还有不少。

不过话说回来,信任这东西本来就是靠一次又一次的正确积累出来的。国产模型的充值才刚开始,未来的空间还很大。

现在 GPT6 回来了,我想先用一段时间再做更完整的对比。也许到时候会发现差距比想象中小,也许会发现有些差距比我想象中更难追。

无论如何,能有选择本身就是一件好事。 有竞争,才会有进步;有对比,才知道差距;有差距,才有追赶的动力。

使用 Hugo 构建
主题 Stack 由 Jimmy 设计
参考 iOS 26 液态玻璃风格改造