当你在两个 JavaScript 框架之间犹豫不决,或者在为下一个项目挑选编排库时,向 AI 求助是很自然的想法。你期望得到一个清晰、明确的答案。然而,你实际得到的结果,很大程度上取决于你打开的是哪一个对话窗口。

Sarah Pan 的直接对比说明了这一点。她针对五个开发者类别,通过 ChatGPT 和 Gemini 运行了二十个完全相同的提示词,希望能看到这些模型是否会对相同的工具达成一致。结果并非如此。这些结果与其说揭示了哪个框架在客观上更好,不如说揭示了每个模型是如何思考的、它们重视什么,以及它们的盲点在哪里。

共同点:经受过实战检验的工具

在一个领域,这两个模型的声音是统一的。当话题转向成熟且被广泛采用的工具时,达成共识几乎是自动的。无论是询问版本控制、关系型数据库、容器化,还是基础前端框架,ChatGPT 和 Gemini 都会指向相同的名称。Git、Docker、PostgreSQL、React——这些在成千上万篇博客文章、会议演讲和 GitHub Issue 中被反复剖析的工具——始终如一地出现。

这种共识之所以存在,是因为这些工具具有难以辩驳的客观特征。它们有记录在案的失效模式、庞大的用户基础,以及足够大的社区,以至于即使是细微的权衡也已被人们充分理解。AI 模型不需要猜测它们的可靠性。互联网已经完成了这项工作,而两者的训练集都反映了这种压倒性的共识。

分歧:新技术与 AI Agent

一旦你进入较新或更碎片化的领域,特别是围绕 AI 工具本身时,这种一致性就瓦解了。在 Agent 框架和大语言模型编排等类别中,两个模型出现了剧烈的分歧。

ChatGPT 一贯推荐与 OpenAI 生态系统相关的工具以及 LangChain。与此同时,Gemini 则倾向于推荐 Anthropic 的产品和 CrewAI。这些选择并非随机。ChatGPT 处于 OpenAI 的产品宇宙之中,而 LangChain 自兴起以来一直是 OpenAI 模型最受讨论的集成层之一。由 Google 构建的 Gemini 则拥有自身的引力,其推荐反映了对 Anthropic 工具以及像 CrewAI 这样强调多 Agent 角色定义的新型专业框架的偏好。

这种分歧凸显了一个关键现实:在新兴类别中,目前还没有单一的市场领导者。由于缺乏多年积累的社区验证,模型会退而求其次,依赖其训练数据中强调最多的内容。看似技术性的建议,往往是时效性、文档密度以及微妙的企业立场一致性的体现。

热门推荐工具的共同特征

尽管在具体名称上存在分歧,但两个模型都青睐具有共同特征的工具。Pan 注意到,在顶级建议中反复出现了四个特征。

首先,清晰的技术文档。不是营销文案,也不是宣传页,而是关于系统如何工作、其约束条件是什么以及内部结构如何的实际解释。其次,活跃的 GitHub 仓库。模型会注意到一个项目是否有近期的提交、响应及时的维护者以及正在处理的待办 Issue。第三,良好的 API 参考文档。具有清晰、结构良好的端点和可预测的请求-响应模式的工具得分更高。第四,强大的社区。无论是通过 Discord 服务器、Stack Overflow 标签,还是高质量的 GitHub 讨论,两个模型似乎都将社会认同视为可靠性的信号。

在这一切之下,隐藏着一个更简单的模式。AI 模型倾向于推荐易于描述的工具。如果一个软件具有清晰的概念边界——例如“一个支持 gRPC 的任务队列”或“一个使用可预测 reducer 函数的状态管理器”——模型就可以充满信心地对其进行推理。如果架构模糊不清,或者功能集散落在链接混乱的微型网站中,即使是一个有用的工具也会变得“隐形”。

两种不同的思维方式

这种分歧比品牌忠诚度更为深刻。ChatGPT 和 Gemini 在评估“最佳”含义时,似乎使用了不同的逻辑。

ChatGPT 倾向于优化通用性。它青睐那些能轻松融入广泛工作流、能妥善处理多种用例并减少开发者上下文切换的工具。当你向它寻求建议时,它往往会稍微重新解读你的问题,扩大范围以涵盖你未提及的边缘情况。其结果通常是一个稳妥的、通用型的选择。

Gemini 则采取更为字面化的方式。它更贴近你提示词的原意,并重视技术上的具体性。如果你要求性能,它会建议围绕原始吞吐量或专门架构构建的工具,而不是全能型工具。它的建议倾向于具有严谨结构设计的工具,即使这些工具需要更多的配置。

这意味着 ChatGPT 给出的答案是你问题的一个略微宽泛的版本,而 Gemini 回答的是你输入的准确问题。这两种方法没有绝对的优劣之分。如果你正在进行原型设计并需要快速推进,ChatGPT 对通用性的偏好可以节省时间。如果你正在优化生产流水线且每一毫秒都至关重要,Gemini 对技术强度的字面关注则更有用。

构建者需要理解的内容

或许最重要的启示不在于该信任哪个模型,而在于如果你真的在构建开发者工具,这意味着什么。AI 不再仅仅是软件文档的消费者,它已成为一个中间层。越来越多的开发者在打开搜索引擎、浏览 Hacker News 或询问同事之前,会先向 AI 获取一份候选清单。

如果你想让你的工具在这一层过滤中生存下来,你需要针对机器理解进行优化。编写大语言模型可以毫无困惑地解析的文档。维护一个显示定期活动的公开 GitHub 仓库。发布结构化且完整的 API 参考文档,而不是将其隐藏在身份验证墙后或埋在 PDF 文件中。用清晰、结构化的语言来描述你的项目。说明它是什么、它不是什么,以及它究竟如何融入技术栈。

这不是传统意义上的搜索引擎优化。它是“AI 可发现性”(AI discoverability)。正如 Pan 的实验所示,模型会根据它们能够轻松理解并自信总结的内容来形成观点。如果你的项目功能强大但难以解释,这些模型会犹豫是否推荐它,尤其是当存在更新或文档更完善的替代方案时。

最后一点警告:将 AI 的建议视为起点,而非排名。它们是受训练数据、知识截止日期和模型特定推理特性影响的观点。当 ChatGPT 推崇 OpenAI 的工具而 Gemini 推崇 Anthropic 时,你看到的是一种偏好,而非证明。

底线是: 如果你正在选择工具,请询问两个模型并比较它们答案背后的逻辑。但如果你正在发布工具,请开始将 AI 视为一种“用户画像”来进行编写。那些能让其软件易于被机器解释的团队,将在开发者开始提问时脱颖而出。

Source: Comparing How ChatGPT and Gemini Recommend Developer Tools by Sarah Pan
Join the GyaanSetu learning community: https://t.me/GyaanSetuAi