一个人管400个AI任务,已经是标配了?|对话GitHub七万星的Orca创始人津晶
Opening: One Person, Hundreds of AI Tasks
恭喜!我刚看了一下,项目已经 49,000 颗星了,马上就要到 5 万颗星。谢谢,哈哈。
估计这个视频发布的时候,你们就已经超过 10 万颗星了。
What problem does Orca solve for Claude Code?
请先介绍一下你们的产品和公司,尤其是给那些平时在用 Claude Code 或 Codex、但从未了解过 Agentic IDE 的人讲讲,你们的产品到底是做什么的。
大家好,我是津晶。我们的产品叫 Orca,是一个 ADE。ADE 是个很新的概念,你可以把它想象成 Agent IDE——一种让人与 agent 高效协作的新型工作平台。
Orca 和直接在终端里用 Claude Code 相比,最大的区别有两点。
第一是集成性。 Orca 把整个工作流所需的各种工具都集成在了一起。比如很多用户会用 Orca 里集成的 GitHub issue 或 Linear issue:从当天要做的 20 条 Linear tickets 开始,这 20 个 tickets 可以变成 Orca 里的 20 个并行 thread;当 thread 有各种更新时,又会自动反馈到 Linear;到最后做 code review 和测试,这些工具在 Orca 里都有集成。所以你不用不停地在五六个不同的应用之间切换,一条路就能跑通。
第二是规模。 在终端里大概跑到 5 个 Claude Code 的时候,你可能已经不清楚谁在干什么活了。但我们的用户一般会同时跑几百个 agents——同时可能有 10 到 20 个不同的 feature,每个 feature 里又有四五个 agent 互相协作,Claude Code 和 Codex 还可以通过 Orca 互相配合,实现非常高的 agent 并行化。
另外一点是,大部分用户在 Orca 里可以直接使用 Claude Code 和 Codex。因为我们专注于工具集成和协作,并没有做自己的 harness,所以用户用 Orca 一分钟就能上手——直接在自带的 Orca Terminal 里就能用上 Claude Code 和 Codex。
ADE and Harness: What's the Difference?
你刚才介绍的这几个,我每一个都有很多问题。第一个,你把它叫做ADE,而不是流行的词比如Harness,这是为什么?或者说在你心中,Harness和ADE的定义有什么不同?第二个,现在很多人——甚至很多程序员——的使用习惯已经越来越多地从Terminal转向了Codex或Claude Code的图形界面工具。在那里似乎也可以同时追踪很多不同的session或worktree,那你们和他们的区别是什么?尤其是这些工具里也集成了Linear、GitHub等等,明显是想集成越来越多的东西。为什么你们能做得比Anthropic或OpenAI还要好?
Harness是loop,ADE是管理人与agent的workflow
第一个问题其实相对简单一些。 Harness可以把它想象成一个loop:你有一个AI,每告诉它做一件事,给它一个input message,它产生一个output message。Harness就是把这个有input、有output的agent做成一个loop,而且不是简单的loop——这个loop还可以调用很多不同的tool,比如routine、tool use等等,可以读你的bash,还可以搜索网页。 所以Harness就是像Codex和Claude Code背后的那个loop加tool use的组合。比较流行的Harness有Pi、OpenCode(OpenCode最近变得比较流行),还有Devin,这些都算Harness。
ADE则是在Harness的基础之上,它不直接与model结合,也不直接去做这个loop,而是把做loop的功能交给现有的各种Harness,自己更专注于人与agent之间的管理workflow。 所以Orca的很多功能,侧重点就在于我们并没有自己的Harness——就像刚才说的,用户可以在Orca里使用Claude Code、Devin、OpenCode这些所有其他的Harness。我们更侧重的是:怎么让大家看到这100个不同agent Harness工作中途的结果,人如果需要提供input,怎么能快速给他们反馈,怎么review他们的最终结果或中途的HTML designs。这就是ADE和Harness的区别。
明白了。比如我们之前做一个翻译任务,其实是用一个Markdown文件加上Claude Code Terminal -p,给它一个prompt去修改这个Markdown文件。做翻译就相当于调用了一个Claude Code的Harness,对文件本身做改动,最后生成结果,中间它也可以输出JSON。而ADE就是把这个过程整个UI化、更系统化地做好——我是在调度100个不同的Claude Code帮我干活。
是的。现在的Orca大约70%是UI,但有30%用户用得比较多的还有我们的CLI。所以它起的是调度作用:不仅可以通过UI调度,也可以通过CLI协调不同的Harness,让它们各自做自己的loop engineering。
Terminal还是GUI:个人偏好与工程取舍
第二个问题,大家从Terminal UI到GUI的转变,这其实是一个个人偏好问题。对我们来说,我们在这上面并没有特别强的vision或opinion——确实有人用Terminal顺手,有人用GUI顺手。从工程角度来说,两者各有优势,Terminal有Terminal的难点,GUI有GUI的难点。在Orca里两种都可以选:你可以把默认视图设为Terminal UI或GUI,还可以在同一个session里自由切换。
不过从商业角度,作为创业者我们是有一些看法的:你得与现有工具衔接得非常好。为什么Orca一开始的形态是让用户用Terminal UI?因为Claude Code和Codex的CLI用户其实远多于它们Desktop App的用户。已经有这么多用户在iTerm或Ghostty里使用Claude Code了,如果我还给他们设置障碍,说"嘿,你别用Claude Code的Terminal UI,来我这用一个不一样的新interface",那每次Claude Code更新,我都得想办法去wrap一下。比如Claude Code最近有很多不同的模式,什么Ultra mode等等,每次他们一更新,我都要在我的GUI里实现一个不一样的rendering,这会影响我们的iteration speed。 所以我们虽然有GUI,但GUI的功能更新肯定没有TUI快,因为在TUI里你能直接得到Claude Code和Codex更新的功能。
有意思,那Codex的GUI和它的CLI(或者说TUI)功能几乎是on par的,这个理解对吗?
是的,因为它是Codex的first-party。但如果你不是first-party,比如Claude Code,它的Claude Desktop功能和Claude Code其实完全不on par,Claude Code一般会领先好多好多步。而且用TUI的话,你还能用到其他很多很好的Harness,比如Pi就是一个非常好的Harness,OpenCode也是。
As AI increases, how should human attention be allocated?
我再追问一个:你前面提到,如果用 Claude Code 自带的终端,同时跟踪五个 session 就已经看不过来了。你们是怎么解决这个问题的?
Claude Code 本身带有很多 orchestration 功能,它的 orchestration 比 Codex 好很多,也有一个 agent view,可以查看几个 Claude Code 的进展。而 Orca 之所以在 Claude Code 和其他 agent 的基础上更进一步,是因为我们有一个很好的 agent status 集成,让你跨越所有 worktree。比如我自己现在有 400 多个 worktree,同时在做 400 多个不同的 feature,每个都可能有推进,有些推进得更快一些。
它能把所有不同 session 的 agent status、跨所有 agent harness——不管是 Claude Code、Codex 还是 OpenCode——集成到一个 agent status 里:这个 worktree 有这几个 agent,这个在工作,这个被阻塞了、需要你立即回应,这个已经完成、需要你立即 review 结果。所以它做了非常好的集成。
我觉得集成性和中立性的价值有时被忽视了。哪怕我的功能和 Claude Code 一模一样,但并不是所有人都用 Claude Code。从我们的用户群体和观察到的大趋势来看,大家正在从单一采购 Claude Code,转向多 vendor 以及 open model 的采购。所以即使功能相同,作为一个能集成各种 agent status、让你用不同 agent 和不同 model 的工具,它也有独特的优点。而且在 Claude Code 基础上,我们也增加了更先进的 agent status 集成和 triage。
把你们的价值分开看挺重要的。比如 vendor agnostic 这一点,很多时候大家非常强调,因为一旦锁定一个 vendor——尤其在 AI 这个时代——谁知道哪个厂子突然又发疯了、不知道干点啥,而且各家你追我赶也很快。所以我们教学时也非常强调跨工具使用,想方设法积累自己的习惯,比如把 skills 放到一个公共目录下,而不是放到各家自己的目录下。
还有一个很重要的维度是花费。AI 的使用习惯和大企业的花费习惯非常不一样,我可以两个都讲,因为花费是工具效率非常重要的一个方面。
多 harness、多 agent vendor 的好处是:比如你的 Claude Code usage 撞到了 limit,你可以在 Orca 里马上——我们甚至有个 handoff 功能——一键把这个 Claude Code 的任务发给 Codex,Codex 就像没事一样继续做下去。这很方便,因为我们自己开发时经常遇到:哪怕我有多个 Claude Code account 可以切换,也没办法无限增加账号,它肯定会限制你。所以我的 Claude Code 用完时可以切到 Codex,最近又有 DeepSeek,我可以用 OpenCode Go,还可以用 Grok;Grok 用完了也可以换到 Antigravity。
所以 cost 是个很重要的维度,对企业来说也是。企业现在对 Codex 和很多 open-weight model 非常感兴趣,就是因为 Anthropic 的账单已经成为他们第一大开销,甚至超过了工程师的薪资。所以无论从效率还是成本来看,多 harness 都更有好处。
好,我们聊下一个话题,我又产生了三个新问题。
Why not fear being wiped out by OpenAI and Anthropic?
先回答最初那个问题:为什么我们的产品不是Anthropic或OpenAI的一个feature?我们的功能确实和Claude Desktop、Codex有很大重合。这里我想引用社区成员的话:他们用了Orca之后,尤其是那些追求100x效率的工程师,都会说不知道为什么Claude Code和Codex就是没有Orca做得好。
当然,这不是一个可以长期防守的位置。目前Orca迭代非常快: 每天发布一个stable版本,每个stable版本基本包含上百个PR,并且持续加入最新的AI协作功能,包括orchestration——让agent管理不同的Terminal,以及把一个workflow从一个agent hand off给另一个agent。这也是Orca名字的来源:orchestration for agent,这是我们一开始就有的概念。那时候Codex的agent还不是self-aware,它困在一个session里,根本没办法把context交接给另一个Codex session—— 这个功能好像是这周才出来的。所以我们一直在领先,永远在布局下一步怎么和AI更好地协同工作。
另一个原因是,我们作为开源项目,本身也是builder,和很多startup builder、hyper-scaling的builder感同身受,这让我们的产品直觉非常准。 比如Claude Code和Codex团队有unlimited token,他们根本不会想到要怎么管理不同的subscription、什么快到期了,以及如果效率不高就没法尽快ship feature——他们处在一个非常cushion的环境里,看到的很多问题和我们的不一样。
更长远的一点是incentive不对齐。他们的incentive是让大家lock in到自己的工具上。抛开中立性和集成不谈,incentive本身也不对齐。
对,能跨Claude Code和Codex使用是我们的核心proposition之一。顺着这个思路,整个产品的设计其实也不一样,而这种设计思路反而更符合大家的使用习惯。 作为一个想一个人用AI成为超级个体、以最快速度迭代产品、处理各种daily workflow的人,我认为在AI时代迭代最快的,就是你自己既是产品经理又是工程师、对问题非常感同身受的时候。而Claude Code和Codex不免要通过产品经理或其他方式去了解用户的问题再迭代,这会造成速度上的差距。
大家都惊叹Anthropic迭代快,但你们其实已经比他们更快了。确实有长江后浪推前浪的感觉。总结一下:一是集成的中立性,二是你们的设计哲学,三是团队的使用场景和他们不同,导致对用户的同理心不同,再加上你们的迭代速度确实更快。
你们团队现在几个人?4个人。厉害。感觉很快就要被OpenAI或者Anthropic收了。
为什么在Pi和OpenCode之上做出这么大一块东西?
我觉得是我们比他们更开放。Orca有一个很大的philosophy,也是一个新趋势,叫Generative UI——一切都可以以plugin的形式集成。Orca也在朝这个方向转型,内部vision和philosophy已经指向那里了。
先说OpenCode。它的开放在于可以集成各种不同的model,但至于怎么loop、怎么和agent交互,它其实不开放——你得用它给你的一套opinionated Harness。而且我们有数据支撑:OpenCode的受欢迎程度还是远比不上Claude Code和Codex。 Orca的擅长之处在于借力Claude Code和Codex:你喜欢Claude Code、喜欢Codex,没问题,来我们这里用。Claude Code有的我们都有,Codex有的我们都有,但我们还有他们没有的。而OpenCode除了model集成更多以外,在Harness上逼着你做选择——你喜欢Claude Code还是OpenCode?不好意思,你得选一个。
和OpenCode、Pi最大的区别是,我们不会逼用户做选择,我们以最大的兼容性让大家使用Orca。
Pi有逼大家做选择吗?当然,你得选Pi作为你的Harness,选了Pi就不能用Claude Code作为Harness。能用Pi去用Claude Code吗?你可以用Pi去用Anthropic model、用Claude model,但没办法用Claude Code这个Harness。 而Claude Code其实是非常好的Harness——我知道有人即使有Pi,还是会去Claude Code里用中转API来使用DeepSeek、GLM、Kimi这些model,因为他想用Claude Code这个Harness。
你之前好像还提到一个词,Ghostty?Ghostty。
Where a Good AI Tool Gets Hard: The Details
So did this product just appear out of nowhere, or did you see something, use something, and iterate on top of it? That's a good question. We had two inspirations. One was internal: we've been building devtools for the past two years and have built a lot of other agents, including a UI testing agent, so we're quite familiar with agent building and managing agent sessions. Some users of that AI testing agent told us our agent management was pretty good, and suggested we could use it to manage general coding agents—that was the internal inspiration.
Three limitations of Ghostty and iTerm
The external inspiration was that our own engineering team also wanted to be ten or a hundred times more productive, so we tried many other tools. We tried Ghostty and iTerm, and at the time we really liked how they let you switch between panes, running different agents in the same screen. That pane-switching mode is a major part of Orca too. But Ghostty and iTerm had three limitations we could improve on, and that's how Orca came about.
First, they aren't worktree-centric. They let you switch between agent panes, but the creation and deletion of GitHub worktrees has a fairly complex lifecycle. There are more and more libraries you can use for this, but Orca lets you manage all your worktrees and the whole PR lifecycle really well.
Second, agent status. In iTerm and Ghostty, Claude Code can modify the terminal title, but that still can't show a full agent status—like whether it's working or needs your attention. And among so many tabs, you completely lose track of agent status; it's just a title, not a real status. We turned this status into an API integration, and Orca now also supports extensions, so people can use our status API to build their own management views.
Third, updates—which I think is a widely overlooked problem. A big reason Orca has become so popular is that we ship daily updates, and users are willing to update daily, so they always get our best features instead of seeing a new feature elsewhere that Orca lacks. Most users update along with us every day. But with Ghostty and iTerm, the moment you update, all your sessions are completely gone. You might have 50 agents running, and after an update you can recover the history, but which of those 50 agents are still running and which have finished—you have to figure that out yourself after every update. So people update iTerm and Ghostty slowly and basically nobody dares to update, which also slows down how fast you iterate together with your users.
How daily updates preserve your sessions
How did you manage that? It actually took quite a bit of work. Every terminal session is a PTY, and on each update we restore all the PTYs. We have a local database that takes a snapshot of each PTY, so when you come back, whatever step it was at, we not only bring the history back—if it was running, we let it keep running. Right, and your dev server and so on—if they were already running, we don't kill the PTY.
That's pretty detailed work. It is. Snapshotting and restoring itself isn't hard, but making it fast is. Because sessions add up and each terminal is very memory-hungry—imagine tracking the state of hundreds of sessions—we built a whole set of performance optimizations around caching and storage.
It sounds like the ideas are simple, but you actually spend a lot of time on this meticulous work. Right. It looks like, "Oh, it's about the same as Ghostty, the UI is similar," but the overall experience depends on many small details we put real effort into. I often tell people: there's a gap between a prototype and a real production product. If your ability isn't there, you can't even see the gap. AI can get you to the edge of the gap faster, but crossing it still takes a lot of time, energy, and skill.
This small example shows that this is really a matter of software engineering capability and genuinely being willing to put in the time. A four-person team—again, impressive. Let's keep going.
400+ Tasks: How to Avoid Monitoring Each One Individually?
刚才聊到的那些 power user,同时开着几百个 session、编排几百个 agent——他们的注意力真的管得过来吗?你身边的人可能都是这样的人,所以会觉得这很正常,但这些人其实是非常非常少的一部分。你需要带着“不是这类人”的同理心,帮大家描述一下他们的日常工作,以及他们是怎么管理过来的。
第一点:选好工具,做好搜索
先从简单的说起:选一个好的工具,比如 Orca。它的设计初衷就是让 UI 和 CLI 能让你直观地看到自己到底有哪些工作内容。
举个例子,大家都用过 Google Docs 或 Notion。如果只有两个文档,一个列表界面就够了;但当你有一千个文档时,很多时候就得靠搜索。所以我们做了很多搜索功能的优化:搜索排序会抓取很多关键词,比如 agent session 的标题、worktree 的名字,以及 worktree 相关的 Linear ticket 里的关键词。通过这些关键词,你能快速跳回去——“我三天前好像在做这个东西,现在进展如何?”一搜,就直接把你带到那个 Terminal 页面。如果你直接用 Ghostty,在一百个 Ghostty 标签页里你根本不知道哪个在干什么。
这不是 agentic 搜索,就是很快的索引搜索。一方面是索引搜索,另一方面其实是你们自己使用了这种全新的工作方式,遇到很多痛点之后针对性地开发——我相信你们的搜索里放了很多以前大家想不到会放进搜索结果的信息。
是的。以前大家会搜 Linear、Google Docs,但没人想到要把 Terminal、各个 worktree 之间的关键词都拿来搜。到现在为止,Claude Code 或 Codex 的搜索其实并不好用——我想搜什么还是搜不出来,我不太信任它们的搜索。当然我们也不觉得自己做到了完美,搜索方面还有很多想提升的。搜索总是在索引的新鲜度和检索速度之间做取舍,所以我们还有很多可以改进的空间。
第二点:让 agent 管理 agent
第二个方式是让 agent 来管理 agent。Orca CLI 自带 orchestration。我们看到很多用户会写一个 orchestration 脚本,其实和 Claude Code 内部的 sub-agent 很相似:你看我的 Linear ticket,收集所有需求,写一份 design doc,反复 review 多遍,review 完了再实现,然后做 QA 测试。Orca 自带 browser use 和 mobile emulator,可以用这些来做 QA 测试,最后给我一个 PR 和一份 HTML report。Orca 也自带 artifact sharing,所以很多用户已经有这样一套现成的 recipe:从 Linear ticket 开始,Claude Code 驾驭着 Codex 或其他 agent,最后交付一个 PR 和 artifacts 供 review。
明白了。其实就是我有一个 task、一个目标,把验收标准讲清楚——什么是好的、什么是不好的、过去有什么问题、做这个目标时希望走哪些步骤:先 plan,写完以后互相校对,校对完还要在实际产品上看。这个过程中人几乎不参与,人只看第一步和最后一步交出来的东西是否合理。
是的。而且如果需要你参与,一开始也可以跟 AI 约定:遇到重大决定、我不太确定时,让我参与——但你给我参与的时候,得给我容易 review 的东西。因为我们自带浏览器,我们发现很多用户连中间问 AI 的问题都会说“给我一个可视化的解释”:这是我想做的事情,你看这个 HTML 页面觉得行不行;行就继续,这一步我了解了。
第三点:自动化
但话说回来,你每天到底要管多少事?你真的看得过来这些东西吗?大家想到这里还是会觉得:四百多个,我怎么管得过来、想得过来、跟进得过来?
这是个好问题,所以我要说到第三点:还是要自动化。比如我这四百多个里面,可能两百多个已经是自动化在跑的,跑成了某种 SOP——就像大家以前用 OpenClaw 那样,有一个类似 manager thread 的东西每天定时跑。为什么 Orca 能做到日更?整个 release 是个挺复杂的过程,你得找到一个很好的 branch to cut,对吧?
It also has to gather information. For example, our AI collects reports from Linear and Slack about whether anyone found bugs in the beta builds. It gathers all of this, makes decisions, and if it needs to ask me something, it sends me a Slack message on its own.
But it's all a very process-driven thing. There's a release agent that runs every hour, checking where the release currently stands and automatically carrying the whole process through to completion.
And this matters because there are just four of us. Beyond engineering, we also run a large Discord community, a WeChat community—
You have a WeChat community too?
Yes, we do. Oh right, I should have invited you—I'd completely forgotten. I'll invite you to our WeChat community. We also have tens of thousands of followers on X.
All of that management is automated as well. Every day it triages how to reply to users and what information we've collected. Orca comes with this automation feature built in: it can connect to your remote host, and these automations run on a shared remote host for our team.
With So Many Agents, How Much Does It Cost Per Month?
大家可能关心的问题是:这些自动化到底要花多少 token、多少钱。Token 消耗肯定不少,如果纯按 API 计费,其实还挺贵的。我自己看 API 用量,纯按 API 算的话每个月要好几万。
但大家都知道,像 Claude Code、Codex、Kimi 这些第一方订阅有大量补贴,因为厂商自身的利润率很高——比如 Claude Code 和 OpenAI 按 API 计费的利润率都是 90%,而订阅套餐则是重度补贴的。所以通过购买不同的订阅套餐就很划算。我基本上每个 provider 买一两个,就够一个月所有的自动化和快速主动迭代的 agent 使用了。 我只买 200 美元档的,因为那是最划算的。所以 Claude Code、OpenCode、Codex、Grok、Antigravity 这些我都有,每个都用一点就行。
Plugin 与 Skill 的区别
主持人追问:你们用 plugin,我的理解是不只是模型 harness,工具甚至其他东西也可以是 plugin。你们的 plugin 理念和 Codex 有什么不同?为什么用 plugin 而不是 skill?
两者有很多共通之处。Skill 更偏向 AI 侧,是 skill 和 command 的集成;而我们的 plugin 更偏向 UI 方面,也就是带用户界面的 plugin。我认为在未来很长一段时间里,UI 和 AI 的使用都很重要——相当于人和 AI 都需要工具上的提升,所以有针对 AI 的 plugin(类似 skill),也有针对人的 UI plugin。
举几个例子:Orca 内部可以打开很多文件格式,比如 Markdown 编辑器、HTML 编辑器和标注器(可以在 HTML 上画画等)。但用户想支持各种不同的格式——比如有做芯片设计的用户,有公司自己的文件格式,想要自己的编辑器;还有人想要 PPT 编辑器、视频编辑器,比如 Claude Code 在左边的 panel 生成了一个视频,他想直接在右边 Orca 里打开它,就像打开 Markdown 文件编辑一样。核心的 Orca 不可能支持所有这些编辑器,所以用户可以通过 plugin 的形式在 Orca 里做很多自己想做的事。
Power Users 在做什么
主持人问:这些 power users 用这么多 AI,大概都在干什么?是在公司打工疯狂卷 PR 吗?
我们的用户和早期 Cursor、早期 Claude Code 的用户有很多重合,都是最早用 AI 提升效率的那批人。常见模式是先做 personal project,觉得好用之后也想在办公时使用。Personal project 包括 Web App、Mobile App,现在越来越流行的是 Desktop App,因为写 Electron App 越来越容易。也有人用来做自动化,比如每天炒股,用 Orca 搜集信息,左边是 Claude Code,右边是它生成的当天股票分析 HTML,用户在 HTML 上加评论和标注后再发回给 Claude Code,两者一起协作。所以个人用途五花八门。
但我们也有非常大的用户群体把它作为日常工作使用。比如 Twitter 上有人分享他的案例:他是一位 Cloudflare 工程师,把每天要 review 的 PR 交给一个 master agent。因为我们支持 nested worktree,他在顶层 worktree 可以开比如 20 个不同的 sub-worktree,同时管理 20 个 PR review。很多大公司的人会想:如果我更高效,是不是可以留出更多时间做其他项目,或者升职更快。
于是 Cloudflare 工程师每天上班一看:今天有 20 个活,就找一个 agent,把这 20 个活丢进去,开 20 个 sub-worktree,下班时喝喝咖啡,看看是不是都干完了,干完了就提交。今天的活就干完了,中间他自己去干什么就不知道了。
主持人总结:产品本身已经介绍得很多了,包括大家的使用情况。如果大家感兴趣,可以在下面提问,你也应该在社区里跟大家多多交流。
From Google to YC: How She Built Products One After Another
Let's talk about your entrepreneurship. You graduated in 2016, first worked in quant, then went to Google, and have been founding startups for about four or five years. And you got into YC with your second startup?
Actually, it was the first one.
Tell me your story.
Growing up, I watched my dad run his own business, and compared to working inside a company, I always wanted to be the one making the calls on what to do. So I wanted to start a company ever since college. But as an international student in the US, I couldn't just jump into a startup right out of school because of visa issues, so I followed the conventional path and joined a big company. Google happened to be in the Bay Area, where the startup atmosphere is very strong. While at Google, I spent my free time attending all kinds of startup events and learned a lot from the excellent founders there.
That was a few years ago, before AI took off. I didn't have a great idea at the time, so I figured I'd just pick something and get started. My first idea was a livestreaming platform for special events—weddings, corporate events, that kind of thing. That project grew well, in both users and revenue, and it got us into YC.
But after graduating from YC, we realized the event space was very challenging. To build a big business, the most important thing is user retention. If all your growth has to come from constantly acquiring new users externally, that's a dangerous situation—you can never guarantee what your ad costs will be next month or whether you can attract enough users. Retention in the event space is poor: even if users come back a year later, weddings are even worse. So we realized the business could generate good revenue, but to become a billion- or ten-billion-level company, you need something people use very frequently.
So our second idea was Stably, which uses AI for software testing. That felt like a very reasonable choice at the time, and Stably did fairly well—we landed quite a few enterprise customers. But the reason we've focused on Orca in recent months is that we realized something: B2B SaaS and dev tools used to reward going deep in a niche area and doing it solidly. Now, though, all dev tools seem to be collapsing into one thing—generating things with AI. Even people building video editors: their workflow can often be handled by Claude Code reviewing video frames, or even doing the editing, with Claude Code prompting Seedance. We found that this general coding workflow can replace many of the specialized workflows B2B products used to serve. Since we had already invested so much in our AI testing agent, we could redirect that investment into a more general-purpose agent.
Now there's something you're understating but that people find almost unbelievable: Orca has been a phenomenal success. Functionally, people ask why a company as strong as Anthropic or OpenAI didn't build it. And on growth—you haven't even focused on growth yet, and with just four people you've reached 50,000 stars on GitHub. I don't know your daily actives or downloads, but presumably proportionally high as well. And this is all very recent. Meanwhile, your previous two ventures also worked out—people say nine out of ten startups fail, so why does everything you do succeed?
My definition of success would probably be reaching the billion-dollar level, but yes, at least every one of them got off the ground. I think there are two reasons. First, we're a very technical team: my co-founder was at Uber and I was at Google, so whatever idea we want to build, we can execute it to the highest standard. We may still have a lot to learn on the business side—idea selection, monetization—but on the product side we can genuinely make it the best.
One lesson I'd share: even though people say AI lets you whip up a product instantly, for at least the next year, building a good product will still require enormous time and token-consuming polishing. So good taste still gives you a significant head start. That's the first point. The second is more specific to Orca's success.
Spending 95% of Time on Product — Where Does Growth Come From?
Orca 增长这么快,是在非常少的 marketing 投入下实现的——我们可能 95% 的时间都在做产品,剩下 5% 就是想发什么发什么,今天发一下 Twitter。能做到这么好,我觉得还是得借力,赶上趋势、借势。
回到我最开始说的 TUI 和 GUI 之争:我们本身就没有一个 strong opinion。我们想做的就是大家想用什么,我们就很好地支持大家用这个,而不是摆在对立面上,逼用户“要么用 Claude Code,要么用我们”。让用户做选择的话,你的 marketing 投入得非常大,才能改变用户的使用习惯。而我们只是让 Claude Code 和 Codex 用得更好、更容易,不需要改变用户习惯,他就能用上你,也会非常愿意分享给同事:“我知道我们刚买了 Claude Code,但不是说你要换新工具,而是用 Orca 能把 Claude Code 用得更好。”所以分享和使用 adoption 都会比较高。
下载量与口碑
问:下载量方便透露大概多少吗?——不会透露具体数字,但下载量肯定比 GitHub star 还要高很多。
问:多少比例来自口碑?对任何一家公司,awareness 和 trust 都是很高的 barrier——大家得知道你们,还要信任到愿意试一下。你们为什么能这么快让大家愿意试用?我觉得确实是赛道的原因。这个赛道很容易传播,因为现在不停有新工具出来,大家都愿意尝试一下:有什么好方法能管理 agent?很多人直接用 iTerm 和 Ghostty,但会遇到我刚才说的那些问题,不太满意,所以总是非常愿意尝试新工具。得到 traffic in 其实挺容易的。
但我们更在乎的是留存率,我们的留存率也挺高。留存率高才有 viral growth,才能一传二。如果用户第一天就没有转化、没有留存,看一眼就走了,就没法散播到第二、第三个人。所以我们非常看重留存率。我们发现用户有一个规律:他基本上试遍了所有工具,有时刚好最后才试 Orca,有时先试了 Orca 又去试一圈新工具,或者同时试——不管先后顺序怎样,最后都会选择 Orca。
留存是产品决定的,而且产品好到一定程度,传播是带指数的:一传二、二传三,一个人推荐几个人。在那之前,traffic in 很简单——但对没做过这个赛道的人可能不简单。同赛道有很多人在做这件事,他们可能都不觉得简单。想想你的 YC 同学们,很多人在做这个,他们不觉得简单。那你觉得为什么简单?可能是我没花很多精力在上面。我想一下,我觉得我们做得不一样的地方可能有帮助。
Leverage marketing
包括做 marketing,我们偏 leverage marketing。怎么解释?它跟我们的产品设计思路非常一致:都是非常借力的。我能看到一些跟我们类似的产品,发的 X post 就是宣传自己产品的新功能,因为他觉得自己的责任就是宣传产品功能。他如果讲一句 Claude Code——因为他永远把 Claude Code 和 Codex 看成竞争关系——比如 Claude Code 今天出了一个 agent,就“哇天呐,天塌了,大家会不会都用 Claude Code 了”。就像我刚才说的,不管 Claude Code 有什么,只要还有 Codex 在,我就保持中立,总有存在的价值。更何况现在不是两家独大,而是非常多的 player。我们的松弛就在于不把任何一家视为 competitor——虽然对方目的是来 compete,但我们觉得这是一个非常 open 的 ecosystem。
这就体现在 marketing 里:Claude Code 发布,我们点赞,说“大家可以在 Orca 里这么用 Claude Code”;Codex 发布,说“新功能 Codex 做得好,可以在 Orca 里用”。大家非常愿意看这种内容,很喜欢学“有什么新的 Claude Code tricks、新的 Codex tricks”。所以我们基本上想什么发什么,可能 5 分钟发一条内容,基本都有好几百赞,就是因为发到了大家喜欢的内容。
Good 和 great 的区别
问:Google 码农千千万,Uber 码农千千万,很多人从 Google 出来也没能力做出那么好的产品。你们所谓好的技术和好的产品能力是怎么培养的?great 和 good 的区别是什么?
技术方面比我们好的有很多,我觉得关键还是要 land——能把一个想法真正执行和落地。我甚至觉得当时我们能上 YC,这可能就是 YC 面试我们最看重的一点:虽然我们的第一个点子并不算最好的点子,甚至之后确实抛弃了那个点子,但不管什么点子,我们都有执行力。作为工程师,执行力不仅体现在技术功能,而是把各个方面都打通:找到一个好的方向,了解这个方向上有哪些玩家、大家的痛点是什么,找到最能引起共鸣的痛点,然后很快解决它,每一步都能很精准地做正确的事。这听起来很简单,但其中每一个步骤背后可能都有十个不同的步骤。
Interviewing 100 Users: How to Ask About Their Real Needs?
我们展开一个具体例子,讲讲当时是怎么找到痛点、怎么解决痛点,以及为什么别人没有找到。
深度访谈100个人
我们的第一个点子是做线上活动的直播。找痛点的方式之一是问身边的朋友。做每一个点子时——包括最近的 Orca——我们都会像最初在黑板上第一次头脑风暴那样,按同样的步骤走: 问上100个人,而且是深度的沟通交流,不是发100份问卷。比如做婚礼直播时,我们会跟最早的很多 couple 说,能不能给你打个电话,非常深入地聊:你为什么会想到用我们这个产品?
访谈中问什么问题
我一般会问:第一,你为什么会想到这个点子?第二,你为什么会找这样一个解决方案,有没有考虑过其他方案?比如第一个点子,我会问:你为什么没考虑 Zoom?Zoom 完全可以,你试过 Zoom 吗?这样就能得到很好的 insight,知道我的优势具体在哪里,就必须加大投入这个优势,也能知道用户考虑过哪些其他产品。
第三点,如果要变现,可以问:你既然说这个问题对你这么重要、要到处找方案,那在类似的产品上你花了多少钱?这都非常重要。
你看过《The Mom Test》那本书吗?
对,我看过。
我想到这本书,是因为你问的是用户在类似产品上花了多少钱,而不是问愿不愿意为我的产品花钱。
对对对。
Michael Seibel 的标准
我们的 YC group partner Michael Seibel 非常直白地跟我们说:你要对用户了解到这个程度。比如做 B2B,要知道对方去年的收入是多少、收入增幅是多少、最大的开销是多少。你能不能成为他们第二大或第一大开销?你能帮他们解决一个多大价值的问题,才能做到这一点? 他说,如果你连用户的收入、增长、最大的问题,以及公司里每个不同的人想解决的问题都不知道,那不管做宣传还是产品设计,都是隔靴搔痒,没办法做到准确。
直接问,不停地问
你想了解用户时会怎么做?
我就直接问客户。很多人可以问,而且我们在湾区对现在的赛道有一些天然优势:我身边的朋友基本都能直接问到你们公司到底采购了什么、营收怎么样、今年 AI tool 方面的 budget 是什么、上次采购花了多少钱。 比如我知道很多公司第一大开销现在已经是 AI 了,而在 AI 之前,第一大开销其实是 Datadog,不是 AWS。
哦对,Datadog 真贵。
对对对。然后还会问今年的预算是什么。如果一个问不到,就不停地问不同的人。我们发现各公司的回答其实大同小异,问上这么多个,大概就知道这确实是一个很好的机会。
关键是要对用户 develop 一个 true understanding,而且这个理解比大家想象中要深很多——很多时候大家以为有了,其实还是表面的。所以一定要不停地问下去:访谈100个客户,问非常具体的问题,不断寻找真实的痛点是什么。
从痛点到解决方案
找到真实痛点后,怎么转化成你们的 solution?
先听他们已有的 solution。一般来说还是回到 leverage,要借力——很多用户内部已经有各种尝试了,你可以问:你试了这个行不行、那个行不行?这就是一个非常好的 baseline。 另外就是快速迭代。我觉得要有很好的判断,但我不能保证判断是正确的,所以快速迭代、得到反馈非常重要,这也是我们做得比较好的地方。特别是现在有了 AI 的赋能:虽然你确认了痛点是真实的,但解决它的方式,可以同时推出三版不同的方案——当然三版都是你猜想最好的。
包括我们的 AI status 集成,也是经过了好几个迭代。现在有很多人会抄我们的 AI status 集成显示,但第一版它放在很中心的位置,我们当时觉得这只是想看的时候再看一下的东西,很随意地放在右边一个角落,结果发现根本没有任何用处。然后我们把它放到不同的位置,试了好多版,也根据大家的反馈调整了很多次。
With so many user opinions, whose feedback should you listen to in the end?
关于如何根据反馈建立真实的 feedback loop——因为很多时候你得到的是有偏差的样本,或者只是声音很大、并不代表真实用户——怎样才能获得有效反馈,从而在快速迭代中找到方向?
这个回答可能不太科学,因为我们目前没有做过任何科学实验,很多还是靠我们自己的最终判断。我们的原则是:无论是社区的 PR 和 issue,还是各个论坛上的反馈,都只作为参考。我们也会做一些定性和定量的集成——比如某个建议来自 50% 的用户,那肯定要认真对待。但所有这些都只是信息。尤其是在 AI 时代,获取信息的方式越来越多,但最终的决定权在我们这个四个人、有很好 product sense 的团队手里。说白了就是相信自己:先收集足够多的信息,然后用你最好的判断做出决定。
我觉得这非常有道理。我采访投资人的时候,他们也说很多时候最后靠的是体感。我自己是做数据科学的,数据能告诉你的东西可能也就百分之二三十,最终还是要看你的 mental model——也就是 product sense,或者有人说的 taste。
Taste 是怎么建立的
能不能聊聊你的 taste 或 product sense 是在哪些关键节点、里程碑或“开悟时刻”建立起来的?有没有某个阶段你突然觉得自己悟了?
最近的一个开悟点是:当我在不同产品功能之间犹豫不决、不知道怎么取舍时,就以我自己作为标准用户来衡量。这恰好是我的赛道带来的优势——我自己就是一个很好的用户,我们又有团队,可以体验很多需要团队协作的 AI workflow;我们之前的产品也卖给过大公司,所以我也了解大公司的 workflow;同时我们现在又是一个快速迭代的团队。所以犹豫不决的时候,我就试一下这个功能能不能提升我们自己的效率。哪怕大家可能不喜欢,它至少提升了我们的效率——而这往往最后反而是个非常好的结果。
更早的一个开悟点是意识到 AI 发展的大趋势:很多产品问题都可以通过 coding agent 来解决。我觉得现在的产品有两个分化:一类是像我们这样做通用 coding agent,帮大家使用 Claude Code、Codex 这类工具;另一类是很多产品在现有 UI 里加一个 chatbox。后者在用户体验上有很多加分,但我觉得 context 的丢失太多了。这给我的产品设计方向带来很大启发:现有很多产品的大方向已经很好了,你不能去对抗它,而要在它之上构建(build on top of it)。这两个开悟瞬间对我都很重要。
第一个项目怎么获得用户和收入
回到你的第一个创业项目:你是怎么让别人知道它、并且收到钱的?
时间点很重要。回想起来,我所有项目的共同主题是:在起步阶段都有很多 inbound。比如 Orca,现在大家正好在管理 agent 上有困难,连 enterprise 都在找解决方案;之前的 Stably 做的是 AI testing——AI 生成了太多 junk code,大家想用 AI 来做测试;第一个项目是 virtual event,当时正好处于 covid 的尾声。我们把它放到 App Store,本来还在想要不要告诉朋友,结果就有好几个素不相识的人直接在 App Store 里找到了我们。总结下来,就是在那个时间点解决了正确的问题。
第二点是要相信平台的分发流量。比如 Orca 的很多流量来自 GitHub 本身——大家直接在 GitHub 里搜 ADE。这是个新词,当时我们是唯一一个标注 ADE 的。我也犹豫过:大家会想 ADE 是什么,我标这个词是不是风险太大?后来我说,不管了,我们就是要造一个新词叫 ADE。现在搜 ADE 或 agentic development 的人越来越多,我们很大一部分流量都来自 GitHub。所以在不同平台上利用好它的流量是很有用的。
明白了——有一个特别好的产品,然后能抓到一个时代的脉搏。
总结得很好,我喜欢“脉搏”这个词。
那你的中医能力就很强了,把脉能力非常强。
Big Tech Moves So Fast — Why Isn't She Anxious?
这正好说到了“松弛感”这件事。为什么你没有那么着急,总觉得机会总是有的,只要想干就能干成?因为饼很大。大家可能想象这是一场零和游戏——Anthropic、OpenAI 吃掉了就没有了——但从历史长河来看,我们可能才刚刚起步。没有人能想象未来人类文明能达到什么程度。大家可能觉得 SaaS 要完了,可这世界上还有这么多可以 build 的东西:我们连机器人都没有呢,我还没有做饭机器人呢,我们还没有登月,还没去过火星,更别说生物方面还有很多突破可做。我对未来特别乐观——身为一个 builder,能做的事情太多了,这个不行,再试下一个就是了。
一方面,我们的松弛感来自确实经历过很多次“这个不行就做下一个”,无所谓,只要还有饭吃就可以。
很多人说 AI 是泡沫,说现在的科技发展是泡沫,包括 AI 对 GDP 没有特别大的正面影响。但你明明知道这些,还是选择了更乐观的信仰?
我乐观的前提是,我其实不相信 AI 能取代人类。AI 的智能和人的智能有很多相似之处,但我觉得它们是非常互补的。两年前我可能没有这么乐观,那时我会说 AI 真的会取代人类——它和第二次工业革命不一样:蒸汽机取代了我们的体力劳动,但我们至少还有脑力;现在 AI 取代脑力,那人还有什么用呢?后来我发现,脑力不是一个简单的维度。比如我的聪明程度和虎鲸(Orca)的聪明是不一样的:有虎鲸擅长的东西,也有人类擅长的。同样,有 AI 擅长的,也有人擅长的。AI 可能会朝一个不同的方向走,虽然大家在把它训练得非常像人,但训练再久,可能也做不出像爱因斯坦提出相对论那样的思考。这是我的乐观。当然,很多 AI 专家可能会打断我说:不,AI 在任何维度都可以降维打击人类。
在我“AI 和人类互补”的观点下,AI 就是一个巨大的生产力提升工具。人类之前有很多没解决的问题,比如生物医疗,还有矿产、对地球的开发。不知道大家对 I 型文明这个概念熟不熟悉——它指一个文明已经能利用整颗行星的能量。我觉得我们可能只走了十亿分之一,还在通往 I 型文明的路上,可以做的事情还有很多。就像人类多年前没想到,解放一次生产力会带来这么大的可能性。
稍微不乐观的部分,来自财富分配。而财富分配非常取决于人和 AI 的智能是否互补。如果 AI 可以完全取代人类,那确实会有非常大的财富分配问题——大部分人会被少数掌握 AI 的人认为没有价值,财富自然不会分配给大家。但如果不管 AI 多聪明,它仍然需要人——哪怕是我们觉得比较愚蠢的人——都能提供 AI 达不到的互补智能,那社会的分配形态也会延续下去。这是我跟技术毫无关系的一点思考。
我部分同意。人确实不可替代,AI 再怎么训练也和人是有区别的。但问题是,我们在教育过程中过度强调了那些可以被 AI 取代的东西,反而没有强调人真正独特的东西。我很看好下一代人:他们真的在一个 AI native 的世界里长大,会反过来强调人性的独特之处——你的 craft、你的兴趣、你的 passion、你的 mastery。而现在,因为工业革命之后把人尽量打造成标准件,这些标准件恰恰是最容易被 AI 取代的。
是的,这确实是一个 concern,中间的转型期会比较艰难。
其实我很喜欢历史,可能也有些过度依赖历史——这种事发生过很多次。工业革命时发生过,工业革命之前也发生过很多次。纺织技术出来的时候,80% 还是 90% 的英国青年失业了,应该是维多利亚女王时期,那一整代青年人都失业了。对那一代人来说非常艰难,但对整个国家和社会,大家找到了新的出路,可以开始钻研科学等等。转型是痛苦的,但终会被历史遗忘——对历史来说,那只是一个小小的瞬间。
但对每个人来说,那五年都是人生很重要的决定点。所以我非常能感受到,不管是做 AI 创业还是做其他行业,大家身上肯定都有一部分焦虑。我在你身上感觉不到什么焦虑。
因为只要跑在前面就可以了,就是适应吧。只要你觉得你能适应,其实就还好。
我们还有一点时间,有没有什么你觉得我应该问的问题,或者你想跟观众们交流的东西?
她看好的三类AI创业机会
展望未来的话,长远来看我总体非常乐观,但也会担忧AI监管和财富分配的问题。从近一点来说,我认为现在比较好的创业机会集中在三个方面。
第一:回归ToC
第一个方向是回归ToC。过去B2B是更好的商业模式——虽然卖给企业不容易,但签的一般至少是一年的合同,给点折扣还能签两三年;即使只签一年,客户的粘性也高,因为切换成本高。
但现在B2B的销售周期依然很长。大家不要以为B2B有了AI就会加速采购——恰恰相反,采购变得更慢了,因为企业现在非常犹豫:买工具还是买AI usage?要买多少?这是个很漫长的过程。而经过漫长的采购之后,往往三个月内他们就开始琢磨如何解除合同。
所以我非常建议——之前碰到美国、印度等地的朋友来问创业建议——去看看ToC,做一些APP。
ToC变好了吗? 变好了,原因在于ROI变好了。以前做一个ToC APP挺麻烦的,现在很多人一个月能做好多个APP,投入变少了。
但供给也变多了,市场上的应用多了100倍,而大家的注意力有限、手机上愿意下载的APP有限,竞争不是更激烈了吗?这要看你做什么类型的APP。如果你的APP是零和游戏——用户要不看TikTok要不看你——那竞争肯定更激烈。但如果你的APP处于一个增长的饼里,做的是以前大家做不到的事——就像iPhone刚出来时的Uber、Airbnb,或者APP自带以前根本不可能实现的AI功能——这个饼其实在增长。只要你能帮大家解决一个实际问题,就不需要担心和TikTok抢时间。
ROI变好的另一个原因是付费意愿增强了。以前ToC用户被Google补贴习惯了,觉得APP就应该免费——Google Maps应该免费、文档应该免费、什么都应该免费。但现在没有人能继续这种补贴了,AI时代没人愿意这样做。对AI usage收费,用户是愿意付费的。我从很多数据看到,C端用户的付费意愿确实在提高。
第二:硬件加软件
第二个方向是硬件,特别是对国内创业者来说。国内非常强的硬件优势,我觉得美国很多年都赶超不了。我知道很多在美国创业的人,只要做硬件相关,供应链就处理不好。我以前有个朋友在美国卖自创的heating system和AC产品,基本上每个月都要飞一次中国,即便如此供应链还是搞不定。国内创业者有这方面的先天优势,可以考虑硬件和软件结合的方向。像Plaud就是一个很好的例子,软硬件结合得很好。
第三:算力
第三点是回到第一性原理思考:compute——芯片、存储,以及把它们集成起来形成的算力。这会是接下来一两年非常火的方向。YC的新batch里就有很多这样的startup,因为YC的batch非常贴合当时的热点,而新batch的热点就是:帮你host模型、帮企业self-host模型、帮你找算力——不管是跑agent的还是跑模型的算力,现在都很紧缺。
举个例子:在湾区,现在你去任何一家苹果店、Best Buy或电脑店,配置越高的MacBook Air越是脱销,全是back order。算力现在非常稀缺,有算力的人会先得一步。这中间有很多套利机会——算力虽然不像电力那样一家独大,做算力还是得是大云厂商,但在这么大的市场里,一些小的机会也是存在的。
我昨天跟一个想创业的朋友聊,跟他说起黄仁勋讲的"五层蛋糕":在算力和模型之间还有一层芯片优化,这是一个纯软件的层。这件事以前是CUDA一统天下,但AI之后我觉得有更多机会。除了算力集成、hosting和serving之外,从芯片到产生token之间的优化,也是一个很大的机会。
关于AI落地服务
B2B不好,那服务类方向呢? 比如类似FDE的服务,或者technical consulting,帮客户落地AI能力——这值得做吗?看个人的接受程度,可能和ToC的情况差不多。
You'd have to adapt constantly—market demand might shift every month. This month the hot topic is helping people adapt to AI and save costs; next month it could be something entirely different. The kind of service I had in mind is using AI to take over a company's workflow directly.
I see why such a thing exists. There's a product in the US that sells for around $60, and it's monopolized by a few companies. From placing an order to receiving it can take a month. It's expensive, and they maintain several layers of middlemen—you can clearly tell it's a system built over a decade ago. I place an order on their website, they pass it to another company, that company emails me, and only after confirmation does shipping begin.
That's something we haven't mentioned yet: traditional industries hold plenty of opportunities too. Take construction—I know quite a few people in it, and they earn excellent revenue, because for them AI is purely an enabler. There's still a huge gap between what Anthropic's products offer in design mode and the actual use cases on construction sites. So I think these are all opportunities—filling the gaps, with many chances to be found.
Great, it's about 5 o'clock your time. Anything you'd like to say to our audience?
Today on Superlinear I saw so many products people have launched—the community is full of talented people. I hope everyone strikes their own gold in this AI gold rush. And if you're not fully satisfied with iterating on AI products or with your everyday business workflows, feel free to try Orca. We ship a new feature every day, aiming to keep everyone iterating at the fastest possible speed.
Definitely. I'll publish this interview on Superlinear as soon as possible and encourage everyone to use your product. The people there are genuinely among the most advanced AI users in the Chinese-speaking world—over 20,000 members and some 700–800 different projects. I'm sure they'll love your product.
Thank you so much. Thanks, and goodbye!