AI Loop:Claude、GPT、Mira 和真正有效的工作方式

发布于 2026年06月30日 23:08 #Agents#Prompt 原文链接

AI Loop:Claude、GPT、Mira 和真正有效的工作方式 封面图
  • Loop 定义为一个递归目标,包含目标、执行、验证、状态和停止条件五要素
  • Loop 仅在任务重复、坏结果可自动拒绝、Agent 能端到端完成且完成客观时值得构建
  • 代码最适合 Loop 是因为测试可自动验证结果,无需人工判断
  • 构建 Loop 应遵循先手动完成、再写标准、加验证器、最后自动化的顺序
  • Mira 提供轻量 Loop 方案,通过自然语言在 Telegram 中创建自动运行的任务

原文链接:https://x.com/AnatoliKopadze/status/2068328135611822149

大家好,我是若风。

坦白讲,Loop 这个词最近被讲得有点玄。它听起来像一个新的 AI 工程黑话,但拆开之后,核心其实很朴素:不要只让 AI 回答一次,而是给它目标、检查方式、记忆和退出规则,让它自己把任务往前推。

AI 已经在每个人手里好多年了。但大多数每天都在用 AI 的人,仍然在用最慢的方式:输入一个请求,等待,修正,再问一次,全靠自己手动推进。

不是因为更快的方法有多复杂,而是因为没人真正给他们看过那东西长什么样。

更快的方法叫 Loop。现在,全世界最好的 AI 工程师都在关心这件事。下面这篇文章要补上那个没人讲透的部分:Loop 到底是什么,它在底层如何运转,什么时候值得用,什么时候只是陷阱,怎么在 Claude 或 ChatGPT 里自己搭一个最基础的 Loop,以及哪些轻量 Loop 已经值得放进日常生活。

大多数人是怎么用 AI 的

仔细看一下「一次只问一个请求」这个习惯,因为问题全在这里。

每一步都要经过你。你决定问什么,你判断答案好不好,你决定下一步做什么。AI 只有在你推动时才会动;你一停,它也停。

这当然能用,但有上限。你才是发动机。AI 只是你手里的一件工具,而工具不会自己工作。

还有另一种方式,也正是顶级工程师正在改变构建方式的原因。你不再一步步带着 AI 走,而是只给它一次目标,让它自己跑完整个流程:它计划,执行,检查结果,修掉薄弱处,然后重复,直到目标达成。你退出来,工作还会继续。

Peter Steinberger 的一句话很适合概括这种变化:

这是你的每月提醒:你不该再给编码 Agent 不断写 Prompt 了。你应该设计 Loop,让它们去提示你的 Agent。

很多人看到这类话会点头,但心里其实不知道它在实践里到底是什么意思。所以我们拆开看。

什么是 Loop

Prompt 是一次性指令。Loop 是一个 AI 会持续追逐的目标,直到它真正到达那里。

你可以把它理解成一个递归目标:你定义目的,AI 反复迭代,直到完成。

Prompt 给你一个答案,然后等你决定下一步。Loop 则会自己跑完整个循环。一个可用的 Loop 至少包含五件事:

  • 目标:它到底要完成什么。
  • 执行:它可以自己采取哪些行动。
  • 验证:它怎么知道结果是否合格。
  • 状态:它怎么记录已经做过什么、失败过什么。
  • 停止条件:它什么时候成功退出,什么时候承认做不到。

真正关键的是后面三件事,而很多人也恰恰在这里把 Loop 做坏。

验证是 Loop 的心脏。没有真实检查,你没有 Loop,只有一个 Agent 在反复同意自己。检查把重复变成进步。它可以是硬测试,比如代码是否通过;可以是可量化条件,比如某个数字是否高于 X;也可以是模型按一套 rubric 评分。没有关卡,Agent 就是在给自己的作业打分,而写出答案的模型通常太宽容。

状态让 Loop 有学习能力。每一轮,AI 都必须记得自己试过什么,否则它会永远重复同一个错误。真正的 Loop 会在旁边保留一小段记录:什么做完了,什么失败了,下一步是什么。明天再跑时,它是接着做,而不是从零开始。当然,这也是成本开始上升的地方,后面会讲。

停止条件让 Loop 保持理智。没有出口的 Loop 会一直跑,直到成功、崩掉,或者把你的账单烧空。严肃的 Loop 至少有两种停止方式:成功,以及硬上限,比如尝试 8 次后停下来汇报。跳过这个条件,你就造了一台可能整晚空转的机器。

Prompt 给 AI 一条指令。Loop 给 AI 一份工作、一个判断完成的办法,以及一条什么时候放弃的规则。

你真的需要 Loop 吗

大多数文章会先把 Loop 卖给你,再告诉你什么时候不该用。但严肃的人实际用的是另一套判断。

只有同时满足四个条件,Loop 才值得构建:

  • 这个任务会重复,至少每周一次。频率更低,搭建成本通常回不来。一次性任务仍然更适合一个好 Prompt。
  • 坏结果可以被自动拒绝。比如测试、类型检查、构建、linter 或硬规则。如果没有东西能替你判失败,Loop 只是在原地打转。
  • Agent 能真正端到端完成工作,而不是做一半就把问题丢回给你。
  • 「完成」是客观的,不是审美判断。如果质量主要靠品味决定,人仍然赢。

漏掉任何一项,就把它留在手动 Prompt 里。

这整个话题的诚实版本是:Loop engineering 确实是真的,但大多数人还不需要重型版本。每个人真正能用起来的,是轻量版本。你要先知道边界在哪里。

为什么代码最适合 Loop

Loop 最先在软件开发里火起来,因为代码是世界上最容易验证的东西之一。

测试要么通过,要么失败。没有什么好争的,所以 AI 总能知道自己是否完成。

一个编码 Loop 会拿到一个目标,以及一套严格检查方式:

  • 改完这个功能。
  • 运行测试、类型检查和构建。
  • 如果失败,读错误,继续修。
  • 如果通过,提交结果或汇报完成。
  • 如果超过尝试次数,就停止并说明卡在哪里。

从底层看,真正的编码 Loop 通常由五块组成。Claude Code 和 Codex 现在都已经提供这些能力。

第一块是自动化,也就是心跳。它让这件事成为 Loop,而不是你手动跑过一次的单次任务。你定义 Prompt、节奏和目标,它按计划运行,不需要你每次启动。在 Claude Code 里,/loop 可以按间隔重跑 Prompt,/goal 会让会话持续推进直到你写下的条件为真,hooks 会在 Agent 生命周期的某些点触发命令,而 cron job 或 GitHub Actions 可以让它在你合上电脑后继续运行。结果会主动回来找你,而不是你到处检查。

第二块是Skill,也就是可复用说明。你不再每次都粘贴一大坨指令,而是把规则、模式、绝对不能碰的边界写成一个文件,让 Loop 每次读取。自动化只要按名字调用 Skill,重复任务就不会烂在一个没人维护的 schedule 里。

第三块是子 Agent,核心作用是让执行者远离检查者。Loop 里最有用的结构技巧,是把做事的 Agent 和检查结果的 Agent 拆开。写代码的模型太容易给自己的作业打高分。另一个 Agent,用不同的指令,甚至用更强的模型和更高 effort,可以抓住第一个 Agent 自我说服后漏掉的问题。写作者可以快一点、便宜一点,审稿者可以慢一点、严格一点。这种分离贡献了大部分质量。

第四块是连接器。它决定 Agent 是只会说「这里是修复方案」,还是能真的打开 PR、关联工单、等构建绿了再通知频道。连接器让 Loop 可以在你的真实环境里行动,而不是描述如果它有权限会怎么做。

第五块是验证器,也就是关卡。测试、类型检查或构建会自动拒绝坏结果。这是决定 Loop 到底是在帮你,还是只是在花钱的核心部件。其他部分都是管道,验证器才让它变成真的。

这些东西叠在一起,就得到大团队正在规模化运行的东西:成群 Agent 在同一个任务上循环,几十个、几千个同时跑。有工程师用这种 Loop 在大约六天内把整个代码库从一种语言重写到另一种语言,手工做可能接近一年。这确实改变了严肃软件的构建方式。但演示里通常不会展示它的代价。

没人提的成本

Loop 消耗 token,而 token 就是钱。问题不只是每一步都有成本,而是成本会复利式增长。

Loop 每跑一圈,Agent 都要重新读取上下文:目标、代码、上一轮结果、失败原因。整个上下文会在每次迭代中再次送进模型,而且会一轮比一轮更大。一个跑了十轮的 Loop,不等于十个 Prompt;它是十个越来越大的 Prompt。

执行者加检查者的结构能提升质量,但也会把账单翻倍,因为现在有两个模型要读同一份工作。

真正重要、但几乎没人追踪的指标,是每个被接受变更的成本。不是花了多少 token,也不是跑了多少轮。如果 Loop 给你十个结果,你丢掉六个,你仍然在做本来想省掉的审查工作。低于 50% 接受率时,它通常花得比省得多。

Loop 还会安静地失败。工程师 Geoffrey Huntley 把一种模式叫作「Ralph Wiggum loop」:Agent 过早宣布完成,带着半成品退出,而 Loop 继续运行、继续花钱,却没有产出。没有能让工作失败的硬关卡,Loop 不会崩溃,它只是静悄悄地给你记账。

所以重型版本属于有预算、有护栏的团队:迭代上限、token 预算、无聊步骤用便宜模型、监控。如果你还不是这种场景,也不是错过了什么。核心思想可以用更低成本、更少设置的方式发挥作用。

正确顺序比工具更重要

如果你真的要构建 Loop,顺序比工具重要得多。

能在生产里活下来的 Loop,大致都遵循同一条路径:

  1. 先手动完成一次,确认任务本身可行。
  2. 写清楚成功标准,让结果可以被拒绝。
  3. 加验证器,让失败自动暴露。
  4. 再加入状态记录和停止条件。
  5. 最后才上 schedule、hooks、cron 或 GitHub Actions。

跳过前面几步,直接把一个还没有被手动跑顺的流程排进计划任务,就是 Loop 半夜炸账单的常见原因。先证明它能跑,再加固它,最后自动化。

任何 LLM 里都能手动搭一个基础 Loop

你不需要编码 Agent,也能感受 Loop 如何工作。现在就在任意 LLM 里,用一段 Prompt 就能手动跑一个简单 Loop。

诀窍是一次性给模型三样东西:目标、严格成功标准,以及一个协议,强制它在停止前自我检查。

你可以这样写:

目标:帮我写一封 120 字以内的产品更新邮件。

成功标准:
1. 读起来像真人,不要营销腔。
2. 第一段必须说清楚对用户有什么变化。
3. 不使用感叹号。
4. 末尾只保留一个行动建议。

流程:
先写初稿。
然后按成功标准逐条评分。
如果任意一项不合格,说明问题并重写。
最多迭代 3 次。
只有全部合格时,输出最终版本。

你会看到模型先起草,再按你的标准给自己评分,找到弱点,然后改写。它会一轮一轮走,直到真正过线,而不是把第一版看起来差不多的东西交给你。这就是 Loop。你用一段话搭出来了。

但注意,最关键的东西仍然缺失:你还是触发器。你打开聊天,粘贴 Prompt,坐在那里看它迭代。关掉标签页,它就消失了。它没有 schedule,没有「每天早上做这件事」,也没有「收到邮件后唤醒」。它不能主动找你,因为它只在你盯着它时存在。

想让 Loop 自己运行、按计划运行、被真实事件触发、无需你看管,通常就要进入前面说的重型世界:工具、托管、代码、关卡和账单。

这适合真正重的任务。但对 99% 的日常任务来说,已经有更简单的现成方案。

把同一个想法放进真实生活

把代码和成本剥掉,剩下的其实是一个非常简单、也非常有用的概念:一个任务可以按时间或事件自己运行,不需要你记得,也不需要你在场。

你不必是工程师才需要它。你只是需要一种为生活而建的 Loop,而不是为代码库而建的 Loop。

有一种免费选择,你只要用自然语言描述就能创建。没有代码,没有托管,没有密钥,没有必须一直开着的标签页,也没有容易搞错的构建顺序。

它叫 Mira,运行在 Telegram 里。你像给朋友发消息一样跟它说话,而它运行的 Loop 叫 Skills。每个 Skill 背后都有真正 Loop 需要的几部分:触发器、动作、自动运行方式。只是你不需要自己把它们接起来。你只要说你想要什么。

这就是一个真实 Loop:时间触发,跨两个连接应用执行多步骤动作,自动运行,并把结果带回给你。你用一句消息就写出来了。

Mira 能做什么

这里是让人真正理解它的地方。Mira 不是一个更聪明的聊天机器人。

它和 ChatGPT 的区别很简单:ChatGPT 回答,Mira 行动。你不是让它写邮件,而是让它发邮件。你不是拿到一个工单草稿,而是在 Linear 里得到一个已经分配负责人的真实工单。它在后台把事情做掉,而且能在每次对话之间记住你。

它通过 Composio 连接 500 多个应用,包括 Notion、Gmail、Google Calendar、GitHub、Figma、Stripe 等。它有跨会话和群聊的长期记忆,也不绑定某一个模型,会根据任务使用 GPT、Claude 或 Gemini。落到具体场景里,会变成这些能力。

工作场景。 它可以在几秒钟内帮你追上 200 条消息的讨论,在你继续聊天时把工单建好,也能在会议开始前把上下文准备好。在群聊里,它记住的是整个团队的决策和任务,不只是你自己的。

创作者场景。 Mira 可以在聊天窗口里端到端制作内容。语音笔记进去,几十秒后变成成稿。一个 brief 变成六个适配不同平台的版本。它还可以在聊天里生成图片和视频,编辑照片,替换背景,制作头像和形象,甚至做口型同步和动画。整个内容流水线都在一个窗口里。

语音场景。 Mira 把语音当作一等输入,这比听起来更重要。它能转写语音消息,把文字读给你听,理解群聊里的语音笔记并总结讨论,在你无法打字时充当免提语音助手。

生活场景。 同一个引擎也可以指向生活里的其他任务:一个督促你保持 streak 的教练,一个真正记得你的日记伙伴,用照片记录热量而不是打开另一个 App,基于你自己错误的语言练习,一个价格合适时提醒甚至购买的航班监控器,一份去掉标题党的每日摘要。

两分钟开始

打开 Telegram,进入 Mira,给它发一条消息。免费访问可以立即使用。

你可以先试这些:

  • 每天早上 8 点,把我的日程和未读邮件整理成一段摘要。
  • 每周五下午,检查我这个项目的开放 issue,并列出最值得处理的三个。
  • 每次我转发一条语音笔记,就把它整理成一条适合 X 的短帖。
  • 每天晚上提醒我记录今天做成的一件事,并把这一周的记录汇总给我。

这篇文章里的任何例子,只要你把它写成一句自然语言,就会变成一个会持续运行的 Loop。

这对你真正意味着什么

写在最后。

Loop 不是一个短期潮流,而是工作归属发生变化的信号。AI 不再只是等你一步步推动,而是开始自己跑完整个任务。

但这也不是一个应该到处硬塞的东西。更多时候,你只会白白烧钱。更稳的起点是:先用那些已经存在、成本足够低的工具,把 Loop 的感觉用起来。只有当你真的感到它不够用时,再开始思考自己到底需要什么样的重型 Loop。

真正的变化不是「Prompt 写得更长」。真正的变化是:你开始设计一个能判断自己是否完成、能记住失败、也知道何时停下来的工作系统。

评论互动

© 2026 王若风的技术博客 · Powered by Astro