Claude劝退5000万,个人AI是刹车还是神谕?
孙宇晨的5000万
Hello,大家好,我是 Lewis,我是 Will。
我们这期想从上周的一个八卦开始,可能网友大家都知道,孙宇晨和景甜的八卦闹得很有意思。
其中有一个桥段,当孙宇晨把他的资产拿到 Claude Code 里面,问说我有 5000 万要不要给的时候,AI 毫不犹豫地说这个钱不要给。你觉得当 AI 可以做这样的决定的时候,他靠谱吗?
我觉得,不知道他当时回答的具体细节内容是什么。如果它分析得比较客观、思维框架比较好的话,我觉得是有借鉴意义的。但是它里面的细节好像是把他所有的资产都扔给了模型,模型去评估一下,然后说这个对你好像没有任何的影响,就 5000 万。
但是对于一般用户来说,你会把你所有的资产,以及这些钱都投资在什么地方,都扔给模型吗?
别说,我还真干过这事。我把这些资产配置扔给 AI 做分析,看假如什么时候达到什么阶段应该怎么拆开,如果想要一些开销的话应该处在什么价位上面。我觉得这比我自己想这事可能会容易很多,而且不需要再找单独的资产顾问帮你去分析。
确实是这样。我只是把我的投资账户扔给了我的 OpenClaw。他只能看到我当时在 Fidelity 账户里面有很多小的投资账户,但也就到此为止了,银行或其他账户的信息我好像还没有全部交给他。 不过确实会觉得,在我目前的阶段,好像还很难去接触到那种资产管理师或咨询师,很难有一个人能够全盘帮着去打理这个事情。 对来说,倒不是说让他们帮我决定什么,而是更多地去了解很多之前不太理解的方面。比如说我做 technology,但对于房地产就没什么概念,不知道这里面到底是怎么想、怎么去衡量。如果有人能提供一些思想框架,帮你快速入门,并且能比较精准地根据你的需求去回答问题,我觉得帮助就挺大的。
懂问题,不懂你
我们将借这个故事聊聊个性化 AI(Personalized AI),也就是为你量身定制的 AI。回顾机器学习的发展,最早的推荐系统旨在做到“千人千面”,根据每个人的需求推送最贴合的信息或建议。然而,目前的 AI 仍停留在比较浅的阶段,像 ChatGPT 等大模型的个性化也比较初级,主要通过加一个 memory 来回答与历史相关的问题,但并未真正让人感受到贴近生活。 以 ChatGPT 等大模型的个性化为例,目前主要停留在较初级的阶段,比如加一个 memory 来回答历史相关问题,但还没有做到非常贴近生活。不知道你怎么看?
我觉得情况可能正好相反。以前推荐系统的内容是平台上已有的固定内容,它会根据内容去对接到个人,但内容本身不会因为人而变化;比如一个视频看过了就是看过了,不会根据想要的内容去东拼西凑。 然而现在的 AI 不同。比如我想买吉他音箱,我拥有哪些吉他、哪些效果器,AI 就会帮我选好音箱并分析原因,甚至还会考虑我家周围的环境、什么时候可以弹等因素来做定制。 这在很大程度上节省了大量亲自去看的精力。你可能懂自己的需求,却不知道市面上有什么产品、哪一个最好。无论是买东西还是资产配置,比如对房地产感兴趣想了解巴西市场是否值得投资,以前觉得根本无法了解,现在一问马上就能得到回答,至少能让你建立一些概念。 我特别同意这一点。在大多数场景下,AI 作为一个工具,帮你把事情从零做到 80 分甚至 90 分已经非常优秀了。至于从 90 分到 100 分,比如投资某个市场是否真能赚钱,可能还是要靠你特有的知识和判断力。 AI 把门槛降到了几乎不存在的地步。尽管它对你不够了解,但它对你的问题足够了解,这种定制化已经好很多了。 你刚才提到的那种能知道你所有信息、不需要你解释和提供更多 context 就能自动根据喜好定制答案的个人 AI,目前可能还不够完整。因为输入端并未获取你的所有信息,很难把你的整套生活都交给它。 确实如此。我举一个今天刚发生的有趣例子。中午有个好朋友邀请我去他们的俱乐部吃烧烤,小朋友可以在那里游泳,两家人便见了个面。回来后我想发个感谢信息,就让 Gemini 随便写几句话。它写的第一个例子是:“非常感谢这次你们来,下回我们来。”但我并没有这个俱乐部,所以根本来不了。 第二个例子建议说可以试用更简短的语气:“非常感谢,娃娃在玩的时候大人们可以非常 chill 地坐在那享受一下。”我说我们其实一点也不 chill,因为一直在泳池边盯着,怕娃娃掉进水里,全程都必须盯着。 这说明很多时候模型很容易理解你的 intent(意图),但周围的 context(上下文)是远远不够的,很难真正做到 personalization(个性化)。刚才我说的只是一个非常简单的例子。
不过在工作场景中,如果你需要频繁处理这类情况,就会想办法把这些信息都接起来。比如你是一个专门负责各处社交的人,就会想办法找一个环境来获取这些信息,例如接入录音设备等方式,以确保 context 非常完整。
幕僚长,不是CEO
我知道其实你之前是有个 EA 的,对吧?然后是不是如果能够做到 Personalized 这种 AI 的话,在一定程度上是不是就可以做到很多跟 EA 一样的事情?他可能会知道一些你的偏好,然后他可以站在你的角度想问题。
我觉得 AI 在很大程度上、很多方面其实比 EA 好用很多,首先它非常快。EA 是什么呢?是 Executive Assistant,中文叫行政助理。
这些助理通常都有一个小问题,在于他对很多事情的知识储备不够。你让他干一些大众让干的事情他能干,假如说做一些简单的事情,回邮件、帮忙打饭,这种能搞定。但如果要涉及到跟一个投资人 follow up,他就不知道应该怎么说这个事情;或者有人采访,要准备一个新闻稿,他也搞不定。以前的话,你作为一个 CEO,要配一个 EA 帮你干杂事、安排行程;要配一个 PR 管理你说话的内容;还有一个 chief of staff 管理向你汇报的 executives。Chief of Staff 能处理很深的事情,比较了解运营、产品、技术是怎么做的,也都有这些概念,而 EA 就搞不定。
现在这些角色其实就被一个 AI 都打通了,不太需要中间这些人。如果有一个 EA 会用比较好的 AI,然后能把这些技能都放进去,很大程度上就能去取代掉很多其他比较专业化的角色。甚至我那个 agent 我其实就管他叫 chief of staff,他就是能管很多事情,然后处理很多以前你需要雇专人去做的事情。
因为说到了 Chief of Staff,就想到了 Grok bot。Grok bot 推出了之后反响也蛮好的,它里边最大的一个 bot 就叫 Chief of Staff,它可以帮你去管理一堆其他的 sub agent 或者是 agent,相当于你通过一个人可以去调度不同的职能。
所以现在这方面,我觉得 EA 如果能配一个 AI agent,其实整体把很多 EA 的能力提升高很多。但是其实在真正的企业里面,他们做的很多东西并不见得是做真正的决策,其实是帮 CEO 或者 Founder 分担,你可以 delegate 一些比较小的 decision 或者一些琐碎事情给他们,而一些大的东西其实还是要返回到人的这边,返回到你这边或者 CEO 这边去做重要的决策。
另外一个角度来想这个事情,CEO 肯定要做决策,但是很多其他不同的 function 的 head,其实起到了知识面补全或技能补全的作用。一个 CEO 不可能方方面面都很懂,像 marketing 不太懂,sales 有 sales、revenue 有 revenue 的人,这些人要把事情处理好、总结好,然后要 CEO 去做决定,或者 CEO 跟这些人去协调。其实这些不同 function head 补全了 CEO 的技能 set,然后让他能更好地决策。
但我觉得现在很大重点是 AI 起到这个作用了,因为很多东西你不懂,你知道 AI 是懂的,你甚至都不需要先去了解好,需要的时候问就好了。所以在很多意义上,我觉得每一个个人他整体的执行效率高很多。这里面比较有一个大的前提,就是你得知道要去问什么,怎么去定义这些职能。如果这些东西没有说清楚,目前来看 AI 还是不太会这么深去思考。
确实,它好像缺乏一个比较缜密的这种思考的框架和模式。因为很多时候你给他了一个任务,他就一股脑去做了。然后我觉得现在很多在训练模型的后期,会说你不要先去解决问题,你要先想一想。
但是这种东西其实还是比较浅。因为这些 thinking token 多数还是我们工程师写进去的,很少会有 CEO 去亲自做 post training。所以这里面很多真正缜密的思考框架、更全面地分析事情的能力,目前确实是模型很难做到的。
就拿工程师举例来说,假如一个工程师曾做过同时在线一亿人的系统,他现在做同样的系统,可能只需要少量的人配备 AI agent 就能搞定。 但反过来是做不到的。尽管如果有正确的人给出正确的指导和方式,把问题定义清楚并拆解成小问题逐个击破,同时还能判断后续做出来的东西是否正确,AI 也能做出来;但如果是不太懂的人去找 AI,就做不出这件事情。
瓶颈还是context
问: 那你觉得其实现在做 Personal AI 最大的障碍是不是还是 context?
答: 对,我觉得其实这里面还是有些机会,就是把 AI 用我们刚才说的这些 harness 框架来处理 context 这件事情,先植入一部分,然后让一个人进来的时候马上上手就可以用了。 其实你现在作为 CEO 去用 Claude 或者 OpenAI ChatGPT,它进来并不知道你是 CEO。就算你告诉它,它也不会怎么样,不会根据你的流程把你 setup 好来帮你做很多事情,但它其实有这个能力。 就像我说的,可能在训练模型的时候就没有这一部分训练数据,很少会有 CEO 坐下来把自己的 day-to-day 写出来,所以这一部分确实比较难。 我觉得像这种高能量或者需要很多 support 的人的 use case 还是可以做的。
咱们当年有一个 APP,后来被 Salesforce 收购了叫做 Superhuman,是一个 email 应用。当时我就特别惊讶,怎么这个年代还能做 email?
那时候它还没有聚焦在 AI 功能上,却能杀出一条血路,做一个更受欢迎的 email 应用。它当时精准的用户侧写就是 CEO、CFO、所有的 C executives、Founders 以及 small startup,这些人每天都有非常多的事情要处理。它非常精准地策划了这些人,所以我觉得现在 AI 是不是也可以做一个这样非常专注的 area 作为切入点。
答: 确实。我最近其实开始用了 Superhuman 的 Docs,它在 UI 和功能上和 Google Docs 几乎完全重合。我昨天还跟一个朋友聊,看这两个 UI 就觉得 Superhuman 的更好用。 它有 page、subpage,可以把东西整合得非常好,右边还有一个 agent panel,打开后可以帮你做辅助修改、写作等。 后来我在想为什么不用 Google Doc,打开发现左边其实 Google Doc 早就出了 tab,不同的 tab 下面还可以加 sub tab,右边也有 Gemini。 我一看其实完全重合,但在体感上,你会觉得 Google Doc 是传统的,你是在写一个 Doc;而在 Superhuman 里面,你感觉是在做一个 collaborative、在一个协作的团队 workspace 下面,大家可以一块过来做事情。我觉得产品的入手点,包括你怎么去呈现那个东西,还是有很大的差别。
AI只是在顺着你
回到个人助理的事,你会相信他的决策吗?或者说,你在多大程度上会相信他的决策?
我觉得可以分成两类。第一类是很多时候我们内心其实已经有一个答案了,比如我们现在讨论的该不该给钱、孙宇晨要不要给钱这种事情,他心里可能已经有答案了,只是需要一个更理智的、或者更能代表他自己的东西来告诉他“No”。对人类来说也很像,很大一部分决策其实就是你需要一个确认(confirmation)。
第二类则是你可能确实不太清楚。不太清楚的时候,你就得问开放式问题,比如“应该是怎么样”、“你让我怎么可以更好地去了解这个问题,给我一个 framework,然后一步一步的”,让它变成一个向导,给你一个好的途径去找到最终的答案。这是我使用它比较多的一个场景。
但是在给出最后结论的参考意见时,我觉得很多时候要看你是不是特别有主见。很多时候我会说:“哎呀,这个好像是你说得有道理,但是我怎么觉得那个更有道理。”经过几个 turn 之后,它的答案就变了,它开始顺着我的意思去说,说我讲的才是最好的。在一定程度上,这好像又回到了你其实还是想要一个声音来对你说“你做的是对的”。
确实,其实这个是特别有意思的一个点。我们就发现大模型正如你所说,会偏向你的取向,想猜出你到底倾向于哪个,然后给你那个答案。如果你写的问题带有某种倾向性,我认为它应该能检测出来,从而顺着给你一个答案。
所以现在我们用 AI 做项目时都会强调:咱们要反着写。要想办法朝反方向写,看它能不能真的找出一些比较有意思、我们没有考虑到的点。为什么反方向会更好?因为如果你倾向性地去写你想要支持的观点,它就会一下子 jump 到里面,这样你反而会失去掉很多的盲点。
有时候看到它做这种特别特别傻的推荐时——甚至当你打的问题有错别字、是一个 typo 的时候——它还是会支持你,就是因为它一直在顺着你的所有决策。
确实确实。因为我在 prompt 里面就会专门设定:你的角色要有独立思考,可以来挑战我的权威和答案。所以一般我的第一轮答案出来都是说“你这个说的有这些漏洞”。但作为一个人的角度,我又觉得我的观点是立得住脚的,于是我开始反驳它。在几轮之后,这个模型能不能坚守它自己原来的思考就不太确定了。而且你很难说最后到底是你真正说服了这个模型,像人一样,还是说它最后只是因为偏好迎合,所以才说你讲的是对的。这个答案很难让人判断这个东西是不是真的立得住脚。
对,这确实是我觉得现在挺大一个痛点,真的不知道谁能把这个问题解决好。但它肯定会是 Personal AI 的一个痛点:你怎么样能帮用户判断这个答案究竟是倾向性的答案,还是基于逻辑分析出来的答案?因为 AI 这两样都会做,而且在你检测不到的时候它就做出来了。
哪些决策交给AI
哪些决策交给AI
问: 在目前这个阶段,AI有哪些决策你是很愿意交给它来处理的?
答: 如果事情本身的成本不大,我就不管它说什么直接执行。比如买东西、去哪玩、吃什么、选菜单或者挑红酒,很多时候就让它推荐,它帮你选了你就直接定下来。 但面对更重要的事情,我的使用流程是用它去做大量的研究。比如我会让它从正反两方面去研究,甚至用不同的AI去研究并汇总信息。 在这个过程中需要避免你的倾向性污染答案。最后的目标是自己要有判断、有明确的思考框架来做出判断。 尽管思考框架、数据源头甚至很多观点都是它提供的,但我希望能非常明确地理解这个事情。这有点像没有AI时你会做大量咨询,找各领域专家看他们的想法,来回讨论后得出答案。 现在能更高效地做这件事,而且能找到的高质量信息比以前大得多,以前不容易随时找到各个领域的专家来回答问题。
问: 有道理。这里有个很有趣的点,我们以前在斯坦福上课时讲,做决策时有百分之七八十的情况人还是会感性用事。 公司里也是如此,大家说要做各种分析、拿出数据,但正常的大企业里,不会有一个一边倒的决定。如果一边倒了根本不用做决策,直接沿着那个方向做就行了,通常一定是有各自的利弊(pros and cons)。 在这些对比下,大家很难做到上课时说的那种客观方法:设定每一项的评分维度、各维度比重,再独立打分加总。 大家好像从不在工作中这样决策,最后往往都是一拍桌子说喜欢这个,然后回过头去合理化(rationalize)自己的决定。 从这一点来说,大模型可以做到非常客观,如果是个性化(personalized)的AI,它也可能做到非常像你,因为人很多时候无法做到绝对客观。 那么,Personal AI 应该是代表我们做出类似的决策、也就是感情用事,还是我们需要一个能够非常客观看到每一件事情的AI?
答: 你的框架挺好的。如果事情比较明确、是要解决问题,AI应该代理掉;如果事情不明确、变数多且随机性大,它可能更多的是提供情感支持(emotional)加上说服(convince)你。 它更多扮演一种劝说和支持的角色,对用户有更大价值。如果AI判断不了或者搞不定,它的焦点在于帮用户把决策做下来,而不是让人陷入反复犹豫。 刚才提到的思考框架挺有帮助的,特别是在犹豫不决的时候。通常你一旦被说服了就接受了,再跟AI聊也不会改变什么。 但如果你还没做决定、还在犹豫时,这些思考框架就很好。不管用什么方法,算出来的答案如果反直觉或差几个量级还能参考,但如果数字很接近(比如52%对48%),那就没有什么意义了。 所以在你形成意见和被说服(convincing)的过程中,AI可能会帮到你很多。
而且我觉得它比以前受情感影响要小得多。但用了多次以后会发现,它受到的最大影响其实是用户的倾向性,因此用户最应该避免的就是给它预设倾向性。
问: 确实。但如果要做 Personal AI 的话,就会存在这个局限性。
答: 如果 Personal AI 要解决很大一部分是 context 问题,把很多历史数据、以前为什么做决策的原因都拿进来,这势必会影响到决策。
因为很多时候我们很难再回去告诉 AI 以前做过的这些决策学到了什么、到底是对还是错,我们可能会把这些反思再交还给 AI。
最近其实在做一个研究,就是探讨怎么根据以前的经验去影响未来的决策,从而达到更好的结果。
当数据特别多时很容易做成传统的机器学习,但如果数据点很稀疏,且各个数据点之间的变量特别多、重叠部分很少,这种前提下怎么做这件事情就是一个挺有意思的问题,而且不一定有人能做好。
现在的人类吸取以前经验教训的能力其实很强,其中也有悟性高的人,其吸取教训的速度比别人快得多。
如果能让 AI 把这方面做好,帮助普通人达到最厉害的一批人那样去吸取经验教训并协助做未来决策,我觉得这就很有价值。
问: 那这个的前提条件是,那些特别牛的人得把这些数据拿出来,或者得提供这个框架?
答: 对,但这也可能是一个可以通过算法解决的问题。其实这跟以前我们做的 meta learning 一样,一直是在 learn how to learn。现在最火的 RSI 也是让它自己去摸索,RSI 核心解决的就是怎样才能高效自我进化的问题。
这么看来这个方向还是蛮有前景的。大公司在这方面做的相对较少,可能还是创业公司做得更多。
大公司的任务重复性比较高,数据也多,单个决策可能没有那么值钱,所以会觉得没有那么大的价值。
但对个人而言,数据量小很多,很多重大决策反而更需要 AI 的帮助,因为个人没有团队去处理这些事情,也没有 EA、咨询或教练机构来帮忙。
我觉得决策是一方面,Personal AI 还有一个很大的作用就是 coaching(教练),你怎么看这事?
拿AI当coach
我觉得现在coaching的两个痛点,就是你找到匹配的人还是比较难的。一个是要背景匹配,然后性格要匹配,然后本身跟coaching之间你要有trust,你要把这些东西都告诉你怎么想,正面想、反面想,人性好的一面和坏的一面也都要告诉他,这样的人才能够帮你去分析。 但是很多时候可能找到那个第一比较难,第二你找到一个人也很难判断他是不是就是那个人。这就跟谈恋爱一样,你可能要试很多,然后才知道哪一样是最适合你的、是最好的。但现实中可能又很难大家有这个时间和精力去找到那么一个匹配的。
当时我们创业的时候也找了很多这种coach,去做各种各样的事情,到最后发现那几个所谓的coach都是套模板。它有一整套模板,你到什么时间段它就给你什么东西,根据你的情况给你匹配一下。 但我觉得AI这方面就强很多。现在我用AI做coaching最大的一个作用就在于是不同文化之间的人际关系处理。这当时我很大的一个痛点,就是你跟美国人怎么打交道,和印度人、日本人、德国人很不一样。特别是当冲突出现的时候,这个事情你怎么去approach,AI是能给一些非常实际的建议的。我目前使用下来都挺好用的,谈及建议的话都比较有效。
确实,要是找一个真人的coach的话,很难会有自己所有的背景知识,他可能只会跟某一两个特定的人种。我们又不是native speaker,英语上本来就是个劣势,特别处理矛盾的时候每一个用词都很讲究,所以用coach一下、再给你措辞一下,效率高很多。 因为我现在用的coach更多的目的就是当成一个sounding board。我说我有什么想法或者看法,更多的时候我可能并不仅期待他能给我一个更好的答案,而是我借助那个机会把东西说出来。说出来的时候其实我的大脑是在思考的,在那个过程中我自己就可能self-improve。 然后你不管是weekly还是monthly地去recursive。在很大程度上,每个人个人用AI的上限还是人自己,AI能帮你干多大事情,很难说能超过你的上限高很多。
孙宇晨相当于有一个财务顾问,然后coach了一下他怎么去处理情感关系,情感关系和是不是要付钱。我也觉得挺合理的。我相信很多人在这种问题上也都会去问一下AI,尽管它跟你已经有答案了,但还是会去问一下,看看AI怎么说。
我其实倒是非常相信这样的未来。在孙宇晨的例子里面,他也是要把上下文堆砌给他,这些是我的所有的东西。但我相信总有一天,只要你一问这个决策我是不是应该make,或者给我一些参考意见,它可能就已经能够自动把之前的这些信息都汇总过来,而不需要你去把所有的信息再去交给他。 因为可能就像我刚刚讨论的,在他管你要这个信息的时候,或者在那个场景下你给他提供信息的时候,你一定是被情感左右的,那个时候有一些偏好,你给他的上下文的数据可能其实就已经会让这个模型去某一个方向了。所以当你想要更客观的选项的时候,可能是让真正的模型去take over,让真正的模型去看到你所有的东西,而并不是你选择性地给他那些信息。 这也挺重要。这还是回到咱们提到的,就是怎么样能不bias你的AI。
上周趣闻
关于 Personal AI,我们先聊到这里。接下来聊聊上周比较有趣的两个事情,在我看来比较大的一件事就是 Hugging Face 被 Nvidia 收购了。 对于 Nvidia 来说,它已经拥有了芯片,把 stack 和 framework 都 build 好了,现在又有 distribution 了。很明显它要吃开源模型、Open weight 模型的这一块市场,这可以说是情理之中,但也很意外。 我们可以找个时间拆一下 Hugging Face 和 Nvidia Open weights 的布局,仔细想想还是挺 exciting 的。
这一周最大的新闻其实是 OpenAI 造了很大的势,宣传 AGI 已经到来,他们运用了最大的算力。甚至有人管现在开始叫 AI 的下半场垃圾时间,因为 AI 太强了,所有的应用都不知道会怎么样。 我还没有深入体验这个模型,但从过去一两个月来看,这些模型很难让人判断它到底提高在哪里。以前做不了的任务现在依然做不了、做得不好,而能解决的问题各家其实都能解决得挺不错。 现在最大的体感是这些 model 一个比一个慢。有时候做着做着要八个小时,早上给的 prompt 到晚上还在弄,结果发现整个方向全都是错的。所以对于 AGI 大模型到底强到什么程度,还是挺拭目以待的。
这其实很有趣,说明大家这个模型还在卷 benchmark。但卷来卷去,其实跟我们已经没有太大关系了。 我们会有多少人拿它来跑奥数题?或者像 Astra 宣传视频里那样去做 3D 建模?我觉得很少。可能日常做做 coaching、问问问题,感觉这个早就已经到来了,大家现在在这个基础上做出来的东西都一样。
对大部分普通用户来说,像 Sonnet 5.0 其实就已经很好了。甚至好多人都不知道自己用的是什么模型,花 20 块钱买个 subscription 就开始用了,一看 default 是 Sonnet,就觉得很好。 更强大的模型正如我们之前讨论过的,可能是用来解决更复杂的问题,但并不是每个人都需要。
这期就到这里,感谢大家收听,拜拜。