<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>GPT-6 on CHEN 的博客</title>
        <link>https://blog.chen-api.cloud/tags/gpt-6/</link>
        <description>Recent content in GPT-6 on CHEN 的博客</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <lastBuildDate>Tue, 08 Sep 2026 15:34:00 +0800</lastBuildDate><atom:link href="https://blog.chen-api.cloud/tags/gpt-6/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>停用 GPT 一个月后，我回来了</title>
            <link>https://blog.chen-api.cloud/posts/returning-to-gpt6-after-a-month-with-domestic-ai/</link>
            <pubDate>Tue, 08 Sep 2026 15:34:00 +0800</pubDate>
            <guid>https://blog.chen-api.cloud/posts/returning-to-gpt6-after-a-month-with-domestic-ai/</guid>
            <description>&lt;p&gt;停用 ChatGPT 差不多一个月了。&lt;/p&gt;&#xA;&lt;p&gt;原因挺杂的。政策层面的不确定性是一方面，费用是一方面，另一方面国产的 Agent 和 Harness 产品确实越来越多、越来越能打了，我想认真试一试它们到底能到什么程度。于是干脆把 GPT 暂时放下了，全面切换到国产智能体加国产模型的组合。&lt;/p&gt;&#xA;&lt;p&gt;这一个月下来，体验其实没有想象中那么痛苦。但现在 GPT6 发布，各种强大的作品展示效果层出不穷，恰逢我的国内免费积分也快用完了，是时候回来再看看了。&lt;/p&gt;&#xA;&lt;h2 id=&#34;切换的过程比想象中顺利&#34;&gt;切换的过程比想象中顺利&#xA;&lt;/h2&gt;&lt;p&gt;先说结论：&lt;strong&gt;从 Codex + GPT5.5 切换到国产智能体 + 国产模型，并没有太多的不适应。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这一点我是真心觉得不错。&lt;/p&gt;&#xA;&lt;p&gt;说实话，一年前如果让我做同样的切换，体验落差可能会非常明显。但现在，无论是豆包、Kimi 还是其他几家，在代码理解、多轮对话、上下文保持这些方面，确实已经做到了一个相当可用的水平。&lt;/p&gt;&#xA;&lt;p&gt;尤其是在一些标准化的任务上——比如写一段业务逻辑、生成测试用例、做简单的代码审查——国产模型的表现已经相当稳定。我日常用 Codex 做的事情，换成国产智能体以后，大部分场景都能接住。&lt;/p&gt;&#xA;&lt;p&gt;从这个角度说，&lt;strong&gt;中美 AI 的差距确实在缩小。&lt;/strong&gt; 这不是客套话，而是过去一个月里我最真实的体感。&lt;/p&gt;&#xA;&lt;h2 id=&#34;具体用了哪些产品&#34;&gt;具体用了哪些产品&#xA;&lt;/h2&gt;&lt;p&gt;先列一下这一个月用过的东西。&lt;/p&gt;&#xA;&lt;p&gt;智能体方面，试了一圈：CodeBuddy、WorkBuddy、Trae、Qoder、千问办公。用下来的感受，一言以蔽之——&lt;strong&gt;都差不多。&lt;/strong&gt; 界面设计、交互逻辑、任务完成度，没有谁拉开谁一个身位的感觉。各有各的小毛病，也各有各的亮点，但整体体验高度趋同。&lt;/p&gt;&#xA;&lt;p&gt;基座模型方面就杂一些了：GLM5.2、GLM5.3、GLM5.3 Flash、Kimi-K3、HY4 Preview、HY3、DeepseekV4 PRO、DeepseekV Flash、QWEN 3.8，能排上号的几乎都跑了一遍。&lt;/p&gt;&#xA;&lt;p&gt;体感上，&lt;strong&gt;推理能力和深度没有想象的差距那么大。&lt;/strong&gt; 大家在逻辑推理、代码理解、方案生成这些方面的表现，说实话已经非常接近了。倒是执行速度和积分消耗，确实让几个 Flash 模型优势巨大——同样一个任务，Flash 模型可能 10 秒出结果还不怎么耗积分，换一个满血版可能要 30 秒还烧掉好几倍的额度。对于日常高频使用来说，这个差距比模型能力本身的差距更直接影响体验。&lt;/p&gt;&#xA;&lt;h2 id=&#34;但信心是另一回事&#34;&gt;但信心是另一回事&#xA;&lt;/h2&gt;&lt;p&gt;话说到这里，但后面还有一个&amp;quot;但是&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;切换过去以后，我发现自己有一个很明显的变化：&lt;strong&gt;对国产产品产出的信心不足。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这种信心不足不是说它们回答得不好，而是一种隐隐的担心——会不会哪里有比较大的理解偏差？会不会有一个看起来很合理但实际上是谬误的答案？会不会在某个关键细节上自以为正确但其实是错的？&lt;/p&gt;&#xA;&lt;p&gt;于是我养成了一个习惯：&lt;strong&gt;同一个问题，用多个国产产品交叉验证。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;A 产品给了一个答案，我再问一遍 B 产品；B 产品说了一个方案，我再让 C 产品看看有没有问题。表面上看这是在充分利用各家的长处，但实际上，这背后是一种不太敢完全信任的心态。&lt;/p&gt;&#xA;&lt;p&gt;反过来说，我几乎从来没有对 GPT 产生过这种需要交叉验证的冲动。不是因为它一定不会犯错——它当然也会幻觉——而是长期以来建立的使用信任，让我在大多数场景下愿意直接采纳它的结果。&lt;/p&gt;&#xA;&lt;p&gt;这种信任不是一天建立起来的，而是在无数次使用中慢慢积累的。每一次它准确理解了我的意图，每一次它给出了合理的方案，每一次它在复杂问题上表现出的稳定性，都在为这种信任充值。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;而国产模型目前还处在这个信任充值的早期阶段。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么信心差距这么重要&#34;&gt;为什么信心差距这么重要&#xA;&lt;/h2&gt;&lt;p&gt;可能有人会觉得，多验证几次也不是什么大事，不就是多花几分钟嘛。&lt;/p&gt;&#xA;&lt;p&gt;但实际使用中，这种信心差距的影响比看起来要大得多。&lt;/p&gt;&#xA;&lt;p&gt;当你对一个工具的产出不够信任时，你的使用方式就会发生根本性的变化。你会更保守，更不敢尝试，更倾向于把 AI 的输出当成&amp;quot;参考&amp;quot;而不是&amp;quot;半成品&amp;quot;。你会花更多时间在检查和验证上，而不是让它帮你往前推进。&lt;/p&gt;&#xA;&lt;p&gt;更关键的是，你不太敢让 AI 深度参与复杂任务。因为一旦涉及多步骤、多文件、需要连贯理解的场景，任何一个环节的理解偏差，都可能像蝴蝶效应一样放大到最后的结果里。&lt;/p&gt;&#xA;&lt;p&gt;这种谨慎在很多场景下是对的，但它同时也意味着你没有真正释放 AI 的能力。&lt;/p&gt;&#xA;&lt;h2 id=&#34;现在回来看看-gpt6-到底有多强&#34;&gt;现在回来，看看 GPT6 到底有多强&#xA;&lt;/h2&gt;&lt;p&gt;GPT6 发布这几天，我看了不少作品展示，确实有一些让人眼前一亮的效果。&lt;/p&gt;&#xA;&lt;p&gt;但看别人演示和自己实际使用，始终是两回事。所以我不想在没有深度使用之前就下结论。这次回来，我想认真对比几个方面：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;  &lt;thead&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;th&gt;维度&lt;/th&gt;&#xA;          &lt;th&gt;国产智能体 + 国产模型&lt;/th&gt;&#xA;          &lt;th&gt;GPT6 + Codex&lt;/th&gt;&#xA;      &lt;/tr&gt;&#xA;  &lt;/thead&gt;&#xA;  &lt;tbody&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;&lt;strong&gt;标准化任务&lt;/strong&gt;&lt;/td&gt;&#xA;          &lt;td&gt;表现稳定，可用&lt;/td&gt;&#xA;          &lt;td&gt;预期会更强，但待验证&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;&lt;strong&gt;复杂理解&lt;/strong&gt;&lt;/td&gt;&#xA;          &lt;td&gt;够用，偶尔有偏差&lt;/td&gt;&#xA;          &lt;td&gt;需要验证&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;&lt;strong&gt;多步推理&lt;/strong&gt;&lt;/td&gt;&#xA;          &lt;td&gt;基本可用，信心不足&lt;/td&gt;&#xA;          &lt;td&gt;需要验证&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;&lt;strong&gt;代码生成&lt;/strong&gt;&lt;/td&gt;&#xA;          &lt;td&gt;质量不错&lt;/td&gt;&#xA;          &lt;td&gt;预期会有提升&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;&lt;strong&gt;使用成本&lt;/strong&gt;&lt;/td&gt;&#xA;          &lt;td&gt;有免费额度，但开始收费&lt;/td&gt;&#xA;          &lt;td&gt;Plus 订阅 + API 按量&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;&lt;strong&gt;信任感&lt;/strong&gt;&lt;/td&gt;&#xA;          &lt;td&gt;需要交叉验证&lt;/td&gt;&#xA;          &lt;td&gt;长期积累，相对更高&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;  &lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;这个表格里的&amp;quot;待验证&amp;quot;不是我偷懒不想写，而是我真的觉得，在没有足够使用数据之前，给任何一个方向下结论都为时过早。&lt;/p&gt;&#xA;&lt;h2 id=&#34;说说费用这件事&#34;&gt;说说费用这件事&#xA;&lt;/h2&gt;&lt;p&gt;既然提到了费用，就多说两句。&lt;/p&gt;&#xA;&lt;p&gt;国产产品的免费积分确实是我这一个月能全面切换的一个重要支撑。但正如前面说的，免费积分总有用完的时候，而一旦开始付费，价格差距就变得很现实了。&lt;/p&gt;&#xA;&lt;p&gt;GPT Plus 每月 20 美元，这个价格虽然不便宜，但考虑到它能提供的能力上限和稳定性，对于把 AI 当成核心生产力工具的人来说，是一笔算得过来的账。&lt;/p&gt;&#xA;&lt;p&gt;国产产品目前的定价策略还在探索阶段。有的免费额度给得很大方，有的已经开始收紧。这种不确定性本身也会增加使用时的心理负担——你不知道下个月还能不能像现在这样用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;最后&#34;&gt;最后&#xA;&lt;/h2&gt;&lt;p&gt;停用一个月 GPT，最大的收获不是发现国产产品已经能完全替代了，而是让我更清楚地看到了&lt;strong&gt;差距到底缩小了多少，以及剩下的差距到底在哪里。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;国产模型在标准化任务上的表现已经相当不错，这是事实。但在需要深度信任、复杂推理和长期稳定性的场景下，要追上的路还有不少。&lt;/p&gt;&#xA;&lt;p&gt;不过话说回来，信任这东西本来就是靠一次又一次的正确积累出来的。国产模型的充值才刚开始，未来的空间还很大。&lt;/p&gt;&#xA;&lt;p&gt;现在 GPT6 回来了，我想先用一段时间再做更完整的对比。也许到时候会发现差距比想象中小，也许会发现有些差距比我想象中更难追。&lt;/p&gt;&#xA;&lt;p&gt;无论如何，&lt;strong&gt;能有选择本身就是一件好事。&lt;/strong&gt; 有竞争，才会有进步；有对比，才知道差距；有差距，才有追赶的动力。&lt;/p&gt;&#xA;</description>
        </item></channel>
</rss>
