跳转至

聊一聊Vibe Coding

不得不说,Vibe Coding 这个概念最近越来越火,但我发现很多人对它的理解其实挺模糊的。今天就好好聊聊这个事,从核心理念到具体怎么落地,再到底层的 AI 知识,一次性梳理清楚。

先说说 Vibe Coding 到底是什么。它本质上是一种新的编程范式,核心思想就是你不再需要逐行手写代码了,而是通过自然语言描述需求,让 AI 来生成对应的代码。你的角色从"写代码的人"变成了"定义目标的人"——你告诉 AI 你要什么,它帮你把具体实现搞定。听起来很美,但实际操作起来还是有一些门道的。

Vibe Coding 的方法论大致可以拆成三层来看。最上层是思考层,负责的是创造性工作,比如问题分析、方案设计、架构规划这些。中间是协作层,就是你和 AI 交互的部分,包括用自然语言沟通、拆解需求、讨论方案。最下面是执行层,代码生成、测试执行、部署上线这些脏活累活都交给它。这样分层的好处是,你把低价值的重复劳动都自动化了,自己就能腾出手来专注在高价值的设计和决策上。

在实际操作中,有三条核心规则我觉得特别重要。首先是清晰表达——你得学会用结构化的语言描述需求,明确输入输出是什么,把上下文背景交代清楚。其次是渐进细化,从宏观到微观一步步深入,先定框架再填细节,中间允许 AI 反过来问你问题。最后是持续验证,边开发边测试,及时拿到反馈然后迭代优化。这三条缺一条,效率都会大打折扣。

说到跟 AI 对话,不同的 Prompt 模式效果差别真的很大。比如"给我完整 code 并解释"这种,新手和懒人最爱用,但很容易陷入漫长的无效循环,用过一次就容易依赖上它。相比之下"只修改我让你修改的部分"就靠谱得多,相当于给 AI 上了个紧箍咒,避免它乱改你的测试用例或者别人的代码。"别自作聪明"这个在特定场景下有用,主要是 AI 过度引申、瞎改需求的时候拿出来用一下,但用多了 AI 就会变得畏首畏尾。"还是不对,再看看"基本是无效的,多数时候 AI 只会说一句"非常抱歉"然后换个随机种子再猜一次,纯属无效沟通。还有个有意思的是"不是,你觉得对吗?",这其实是在给 AI 做反向图灵测试,能测出 AI 的"墙头草"属性。至于"你再仔细读一下题目"——把锅甩给 AI,能不能蒙对答案全看运气。

那一个完整的 Vibe Coding 项目应该怎么走呢?我总结了一套流程,从想法验证到项目重构都有覆盖。第一步,在投入任何开发资源之前,先让 AI 对你的想法做一轮压力测试,从多个角度质疑和验证,评估可行性和潜在风险。第二步,基于验证通过的想法,让 AI 帮你生成结构化的产品需求文档,把项目目标、功能范围、用户场景和技术约束都明确下来。第三步,对方案进行追问和细节补充,让 AI 多轮提问来发现那些被忽略的边界情况和设计盲区。第四步,确定前端设计基调,在正式编码之前把 UI 方向和组件规范敲定。最后才是开发、测试和重构的循环。顺便说一句,在方案阶段我个人比较推荐用 Gemini 来收集灵感和写方案,它的多模态能力和长上下文优势在头脑风暴阶段特别好用。


聊到负责任地使用 Vibe Coding,有几个事必须说清楚。为什么要关注它?核心原因是 AI 能力的增长是指数级的。AI 可完成的任务长度每 7 个月翻一番,现在大约能处理 1 小时的工作量,未来很快就能生成一整天甚至一周的工作量。如果你还靠人工逐行审查,根本跟不上这个节奏。想想编译器的发展历程就懂了——早期的开发者需要验证汇编代码,后来通过信任编译器实现了规模化开发。Vibe Coding 差不多也是这个道理,软件行业正在从"每一行都亲自写"走向"信任 AI 直接交付"。

具体使用时,有四个原则值得记住。第一,优先在代码库的叶子节点上使用 Vibe Coding,也就是那些不被其他部分依赖的最终功能和修饰性代码,这样即使出了技术债务影响也可控。核心架构和底层部分还是得自己深入理解。第二,做好 AI 的"产品经理"——就像指导新员工一样,把你的需求、规格、约束和代码库背景都交代清楚,提前做好准备。第三,强调可验证性,设计一些容易人工确认的输入输出检查点,就算不读全部代码也能保证正确性。第四,接受指数效应,现在不用 Vibe Coding 影响还不大,但未来 AI 能生成的工作量越来越大,不适应就会成为瓶颈。

指数增长这个事值得多说两句。它不只是"持续变好",而是"加速变好",就像计算机内存从 KB 级到 TB 级的飞跃。未来 AI 能力可能呈数百万倍提升,我们现在就得提前适应这种变化。在具体的工作流上,有人推荐 Claude Code 加 Cursor 的组合——Claude Code 做整体规划,Cursor 做具体修复。关键节点上记得压缩会话上下文,减少冗余。生产环境还是需要技术背景的人来把控,非技术人员适合低风险场景。长期来看,未来趋势是通过框架把核心功能(比如支付系统)隔离起来,只允许 Vibe Coding 填充 UI 层。


说完了方法论,再聊聊一个很多人没意识到的坑——信息茧房问题。你有没有发现,很多人用 AI 的方式是这样的:开一个对话,把所有问题一股脑丢进去,方案让它写,审阅让它做,优化还是让它来。越聊下来,它说的每一句话都是你想听的话。一个对话框从头聊到尾,上下文越长,AI 就越懂你,效率似乎越高。

但问题恰恰出在这里。AI 的底层逻辑是基于上下文生成最"连贯"的回答,是最连贯,不是最正确。当你在一个对话里聊了 20 轮之后,AI 已经完全"锁定"了你的思路框架。你问它"你觉得这个方案有没有问题",它大概率会说"整体不错,有几个小地方可以优化"。因为这个方案就是它在前面帮你一步步搭出来的。你让它自己否定自己?它做不到——不是技术上做不到,是概率上它不会这么做,因为否定前文会导致"不连贯"。所以我们其实是在跟一面镜子对话,你说什么它就反射什么,只不过反射得更有条理。

那正确的做法是什么?核心思路是不要试图在一个 AI 对话窗口里加一段超级长的 Prompt,而是要分开搞。同一个问题,至少开两到三个独立对话窗口,也可以切换不同的 AI 工具,分配不同的角色。一个当支持者,全力推演方案的优势和可行点。一个当批评者,专门挑漏洞找风险。再来一个小白用户,从外行视角提基础疑问。然后你把三份输出汇总起来,重点看那些说法矛盾的地方——支持者认可的优势可能恰恰是批评者判定的致命缺陷,这些冲突点才是需要你深度思考的核心。而那些三方都达成共识的内容,就不用过多纠结了。最后,你得自己来做最终判断,结合对业务的深度理解、对用户的认知和对市场趋势的判断来拍板。AI 本质上就是个素材生成器,它能在 5 分钟内给你生成 10 个方案、20 个角度、30 个论据,但它不是决策者。让它帮你把信息摊开,把矛盾暴露出来,然后你站在这些矛盾中间做判断。处理复杂问题的时候,AI 对话越长思路就越窄。不是因为 AI 变笨了,是因为它太懂你了——而一个太懂你的人,不会让你听到真正需要的信息。


再往前一步,说说具体怎么跟 AI 协作。大多数人跟 AI 协作的方式其实是有致命缺陷的——直接把完整需求丢给 AI,让 AI 一次性输出成品,然后人工审阅内容,逐处纠错,反复迭代修改。结果对话上下文越长,修改越混乱,返工量暴增。问题的根源在于双方的信息认知错位,你以为 AI 完全理解了需求,AI 以为你表述得清晰了,两边在错误方向上持续推进,等发现产出偏离目标的时候,沉没成本已经很高了。更严重的是,很多时候你自己都没完全理清整件事的逻辑,直接让 AI 输出,等于把没想明白的工作全甩给 AI 兜底。

有个简单的微习惯可以彻底改变这个局面:先对齐,再开工。在你让 AI 做任何事之前,先用这样一个 Prompt 开头——"我要用你帮我完成 X,最终目标是 Y。在正式开工之前,先输出这件事的完整整体路径,梳理任务全程的潜在问题和核心关键节点,整理一份标准化项目指导文档。我们先针对这份文档逐条补充细节,等我确认无误之后,再正式开始落地执行。"这份文档需要包含整体执行路径、过程潜在风险、关键时间节点和分步骤行动建议。先和 AI 对齐全局文档,双向补充细节,确认完了再进入正式产出。就多这一步,能省掉后面无数的返工。

如果你还想更稳妥一点,可以再加上多模型交叉验证。把 AI 生成的项目指导文档分发给几个不同的大模型,让它们全面审阅,挑出所有逻辑缺陷和漏洞,汇总反馈后再回头修正原始文档。这个方法适用性极强,不管是开发、写作、策划还是设计,都推荐试一试。这套"先对齐、再协作"的模式带来的改变是实实在在的——大幅减少反复返工,协作流程标准化,而且适用范围非常广。说白了,不存在什么速成暴富的套路,这套方法的本质就是学会正确驾驭 AI 工具,放大你自身做事的能力。


最后聊点基础的东西。如果你想好好玩 Vibe Coding,还是得对 AI 大模型有一些基本的认识,不然跟 AI 沟通的时候容易鸡同鸭讲。

先从概念说起。AIGC 就是 AI Generated Content,AI 生成的内容,包括文字、图片、音频、视频这些。海外更流行的叫法是生成式 AI,其实是一回事。它们的层次关系大致是这样的:人工智能包含机器学习,机器学习包含深度学习,深度学习包含生成式 AI,生成式 AI 包含大语言模型。LLM 就是 Large Language Model,用来做自然语言相关任务的深度学习模型,可以完成生成、分类、总结、改写这些事。所谓的"大",不只是训练数据量大,更是指参数数量巨大。GPT-1 有 1.17 亿参数,到了 GPT-3 已经到了 1750 亿参数。参数越多,模型能力就越强,一个模型就能替代以前很多单项任务的模型。

这些模型背后大多跑在 Transformer 架构上。这个架构是 2017 年谷歌那篇著名的《Attention Is All You Need》提出的,GPT 和 BERT 都是基于这个架构。它的核心创新有两个,一个是自注意力机制,处理每个词的时候会关注输入序列里的所有词,通过计算相关性来确定注意力权重,解决了长距离语义依赖的问题。另一个是位置编码,把词的位置信息转化成向量跟词向量相加,让模型能理解词序,同时还能支持并行计算,训练效率高了很多。后来这个架构也分出了不同的变种,BERT 这类仅编码器的擅长语言理解,GPT 这类仅解码器的擅长文本生成,T5 这种编码器-解码器结构的适合翻译和总结这类序列转换任务。

一个大语言模型的诞生大致要经过三个阶段。首先是预训练,用海量的无监督文本数据训练基座模型,通过不断预测下一个 Token 来学习语言规律。这个阶段成本最高,GPT-3 当时训练了几个月,用上了上千块 GPU。然后是监督微调,用人类撰写的高质量对话数据进行监督学习,让模型具备对话能力。最后是强化学习阶段,训练一个奖励模型,让它对 SFT 模型的回答评分,再用评分作为反馈来优化模型。成本是依次递减的。

跟这些模型打交道的时候,有几个技术概念值得了解。小样本提示就是给 AI 提供几个示例,利用它的上下文学习能力让它模仿着来。思维链则是在提示里展示推理步骤,让 AI 也生成中间过程,这在复杂推理任务上效果提升很明显。最近很火的推理模型,像 O1、O3、DeepSeek R1 这些,是在训练阶段就强化了多步推理能力,可以自己在内部做链式推理。另外还有一些外挂技术,RAG 是把外部文档分段转成向量存进数据库,提问时匹配相关段落作为上下文,适合做知识库。PAL 是让 AI 生成计算的代码,通过代码解释器执行得到结果,适合数学计算和精确推理。ReAct 框架结合了推理和行动,通过"推理—行动—观察"的循环跟外部工具交互,适合需要多步推理的工具调用场景。

大概就是这些了。Vibe Coding 这个事说到底,工具在快速进化,但用好工具的核心还是你自己——你的思考能力、判断力和对问题的理解深度,这些东西是 AI 给不了的。

评论