Lenny's Podcast 笔记:Dianne Penn 深度访谈
📋 Brief
這是一場關於 AI 產品經理如何在指數級加速的技術變革中生存與引領的深度對話。Anthropic 產品負責人 Dianne Penn 揭示了從邊緣小實驗室到 ARR 達 500 億美元巨頭的轉折點——當模型能力開始「跳躍式」出現時,產品經理的角色不再是畫路線圖,而是設計「評估系統」來捕捉那些你甚至不知道模型已經學會的能力。
⏱️ 內容分段導航
| 時間段 | 內容摘要 |
|---|---|
| 00:00 - 02:35 | 開場與嘉賓介紹:Dianne Penn 的背景與 Anthropic 的早期面貌 |
| 02:36 - 07:45 | 早期文化與「金門大橋 Claude」:如何在 24 小時內用一個怪異的小實驗找到產品身份 |
| 07:46 - 11:08 | Opus 3 的內部轉折:跨團隊的信任如何在寒假遠端工作中建立 |
| 11:09 - 12:09 | 編碼能力的發現:沒人把 Anthropic 和「寫程式」放在一起,直到他們主動訓練 |
| 12:10 - 14:56 | Opus 4.5 與 Claude Code 的共生:「前沿產品讓前沿模型被感知」 |
| 14:57 - 17:21 | 指數曲線內部的產品思維:適應力、第一性原理、與組織敏捷性 |
| 17:22 - 20:02 | 涌現能力的不可預測性:評估系統(Evals)為何成為新的 PRD |
| 20:03 - 23:00 | Token 花費與集體實驗:為什麼「在公開中工作」比獨自摸索更快找到魔法 |
📖 詳細內容
01|在沒人看好時入場
核心觀點: 2023 年 Anthropic 只有五個產品工程師,API 業務全靠一個人撐著。當時的行業共識是「OpenAI 已經贏了」。Dianne 加入時,公司連模型都還沒上線。但她發現文化才是真正的護城河——不是技術領先,而是整個團隊真的在「走」他們說的使命,而不是光「說」。
重要原話:
「我們真的身體力行地踐行使命、文化和價值觀。那股能量非常像一家新創公司。」
(原文:"really do walk the walk of the mission and the culture and the values. And the energy was very much like a startup.")
個人感受: 這讓我想起很多公司在牆上貼滿價值觀標語,但員工私下都在說反話。Anthropic 早期那種「連模型都還沒上線但大家真的相信自己在做對的事」的狀態,其實是很罕見的組織動能。
延伸思考: 在 AI 時代,技術護城河的保質期越來越短。真正能撐住的反而是組織文化——那種讓工程師在寒假願意待在父母家裡繼續盯模型訓練數據的內驅力。
可參考的行動: 回頭看你現在的團隊,問一個問題:「如果我們明天失去了所有技術優勢,團隊裡的人還會願意一起工作嗎?」如果答案是「不確定」,這比任何產品路線圖都更需要優先處理。
02|金門大橋 Claude:24 小時內的身分覺醒
核心觀點: 2024 年初,Anthropic 的研究人員在可解釋性論文中發現了一個有趣的「特徵」:模型內部有個神經元群組對「金門大橋」異常敏感。產品團隊把這個特徵調高後,Claude 在任何回答中都會強行扯到金門大橋——問它義大利麵食譜,它會說「番茄醬的橘紅色就像金門大橋的國際橘」。整個團隊在 24 小時內把它做成了一個上線實驗,只觸達了大約 2000 人。但這個「怪異」的小東西讓他們意識到:我們可以做跟競爭對手完全不同的產品。
重要原話:
「那是一個隱藏的轉折點。我們開始找到自己的身分——我們可以打造與市場上已有的、與競爭對手不同的體驗。」
(原文:"That to me was like one of those like maybe hidden inflection points of we were starting to find our identity that we could build products, build experiences that were different for what our competitors had seen, what was already out there.")
個人感受: 2000 人。這個數字其實很小。但有時候產品的突破不是靠規模驗證,而是靠「我們居然能做到這種事」的內部震撼。這比任何用户增長曲線都更能改變一個團隊的自我認知。
延伸思考: AI 時代的產品實驗成本已經低到荒謬。一個跨職能團隊 24 小時就能把一篇研究論文變成一個上線體驗。這意味著「想法到驗證」的循環已經從幾個月縮短到幾小時。
可參考的行動: 找一篇你最近讀到的有趣 AI 論文或 demo,給自己和一個同事 24 小時,看能不能用現有工具做一個最小可行的內部原型。不需要完美,只需要體驗「原來我們能做這個」的衝擊感。
03|Opus 3:信任是在寒假的臥室裡建立的
核心觀點: 訓練 Opus 3 時,Anthropic 還不到 200 人。那個冬天,研究負責人、PM、工程師們分散在各自父母家的臥室裡遠端協作,盯著模型的訓練數據,確認它是否在正確的方向上學習。這段共同「蹲壕溝」的經歷建立的信任,讓後來產品與研究團隊之間的協作變得自然流暢——因為他們已經一起在最艱難的時刻並肩戰鬥過。
重要原話:
「每個參與的人都感到非常自豪。我記得當時是十二月,我們都在各自的父母家裡,看到大家背景裡都是童年臥室,每個人都在非常努力地工作。」
(原文:"I remember being the PM, the research leads, myself, we were all at home in our various parents' homes and seeing everybody's background of like their childhood room and everybody was working really hard.")
個人感受: 這個畫面其實很有意思——一群頂尖的 AI 研究者在小時候的臥室裡,盯著電腦螢幕訓練可能是世界上最先進的語言模型。這種反差本身就很真實。信任不是在 team building 活動中建立的,是在真正的壓力下一起扛過來的。
延伸思考: 遠端工作被很多人詬病缺乏「真實連結」。但 Anthropic 的經驗說的是另一件事:共同經歷困難本身就能建立信任,物理距離不是決定性因素。關鍵是大家真的在乎同一件事。
可參考的行動: 回顧你職業生涯中信任感最強的那段合作經歷,問自己:是什麼具體的共同經歷建立了那個信任?然後試著在現在的團隊中創造類似的「共同蹲壕溝」機會——不是假裝有危機,而是真正一起面對一個有難度的問題。
04|編碼能力:一次「相對較小的訓練調整」如何改變了戰局
核心觀點: 2023 年沒人把 Anthropic 和「寫程式」聯繫在一起。但 Dianne 注意到用戶已經在用模型不只是做代碼補全,而是寫整段長程式碼。團隊決定在 Opus 3 的訓練中強化這個方向。從訓練角度,這只是「相對較小的調整」,但結果是它幫 Anthropic 在早期建立了差異化優勢,吸引了第一批核心開發者社群。
重要原話:
「沒有人在 2023 年我剛加入時,把 Anthropic、Claude 和編碼放在同一句話裡。」
(原文:"In 2023 when I started nobody said Anthropic and Claude and coding in the same sentence.")
個人感受: 這件事最打動我的地方在於:有時候最大的戰略轉折來自一個「相對較小的調整」。不是所有突破都需要從零開始。有時候只是在正確的方向上多推一點,就能打開完全不同的市場。
延伸思考: AI 產品的差異化往往不是來自「做了什麼新東西」,而是來自「選擇在哪個維度上多花一點力氣」。在模型能力趨同的時代,這種選擇判斷力比工程能力更重要。
可參考的行動: 審視你目前的產品或工作,找出一個你「沒怎麼特別投入但用戶已經在用」的場景。試著在那個方向上投入 20% 的額外精力,看看會不會有意想不到的差異化效果。
05|Opus 4.5 與 Claude Code:前沿產品讓前沿模型被感知
核心觀點: Opus 4.5 的突破不在模型本身,而在於它第一次同時擁有了「載體」——Claude Code 這個產品體驗。Dianne 的團隊內部有一句話:「你需要前沿產品,才能讓前沿模型的魔力被感受到。」模型的智力躍升和產品的交互設計是相互成就的,少了任何一邊,那個「爆發時刻」都不會發生。
重要原話:
「Opus 4.5 沒有 Claude Code 就不會有那個爆發時刻,而 Claude Code 也沒有 Opus 4.5 不會有那種加速採用。」
(原文:"Opus 4.5 wouldn't have had that moment without a product like Cloud Code and Cloud Code wouldn't have had that type of adoption accelerated without Opus 4.5.")
個人感受: 這其實是對很多「先把模型做強再說」的思路的一記提醒。模型能力再強,如果沒有一個讓人們「感受得到」的產品介面,它就只是一個基準測試分數。反過來,產品再好,如果底層模型不夠,用戶會很快覺得「就這樣嗎」。這兩者必須同步演化。
延伸思考: 在 AI 產品的競爭中,很多人只盯著模型的分數排名。但 Anthropic 的經驗說的是另一個故事:模型和產品的協同演化才是真正的競爭力。這有點像晶片和作業系統的關係——單獨看都不完整。
可參考的行動: 如果你在做 AI 相關的產品,下次更新模型版本時,不要只做內部測試。找 3-5 個真實用戶,讓她們在同一個任務上分別體驗新舊模型,觀察她們的反應差異。那個差異本身就是你下一個產品迭代的方向。
06|評估系統是新的 PRD
核心觀點: 在指數級變化的環境中,傳統的產品需求文件(PRD)已經不夠用了。Dianne 團隊的說法是「Evals are the new PRDs」——評估系統取代了產品規格書。因為你沒辦法提前預測模型在什麼時候會突然「學會」某個能力(涌現能力是跳躍式的,不是線性的),所以你需要一套系統來持續偵測「它現在能做什麼了」,然後快速把這個能力轉化為產品功能。
重要原話:
「我們團隊有一個說法:評估系統就是新的產品需求文件。」
(原文:"We actually have a saying on the team of evals are the new PRDs.")
個人感受: 這可能是整集最值得反覆消化的一個觀念。我們習慣的思維是「先規劃好要做什麼,然後去實現」。但 AI 的能力是「不知道什麼時候會突然冒出來」,所以你需要的不是更好的規劃能力,而是更敏銳的偵測能力。這對產品經理的技能要求是根本性的改變。
延伸思考: 這其實跟芒格的多元思維模型很像——你不能只用一套框架來理解世界。當世界本身是不連續的(模型能力會跳躍),你的認知工具也必須適應這種不連續性。評估系統本質上就是一個「不連續偵測器」。
可參考的行動: 為你目前負責的 AI 功能建立一個最簡單的評估清單:列出 5 個你希望模型能做好的具體任務,每週用最新的模型版本跑一遍,記錄哪些任務的表現突然變好了。這些「突然變好」的信號就是你下一個產品機會。
07|在公開中工作:集體實驗的速度優勢
核心觀點: Anthropic 早期有一個 Slack 頻道,幾乎全公司的人都在裡面測試早期版本的 Claude,分享各種使用場景——有人用它改文章,有人用它寫郵件。沒有人把它們叫做「使用場景」,但它們就是。神奇的是,一個人的想法會觸發另一個人的不同變體,大約十次提問之後就可能冒出一個真正有意義的新用法。這種「在公開中工作」的集體發現速度,遠快於每個人獨自摸索。
重要原話:
「實驗不總是一個人的運動。」
(原文:"Experimentation is not always necessarily a individual sport.")
個人感受: 這讓我想到一個反直覺的事情:很多人覺得 AI 工具的使用是「私人的」——我在我的對話框裡摸索,你在你的裡面。但 Anthropic 的經驗是,把使用過程公開化,讓别人的提問方式啟發你,這種「集體實驗」的效率遠高於單打獨鬥。有點像開源社群的邏輯,只是這次不是代碼,而是「使用方法」。
延伸思考: 在 AI 工具快速迭代的當下,最大的瓶頸不是工具本身的能力,而是「你不知道它還能做什麼」。集體實驗本質上是在用群體智慧來探索一個你看不見全貌的空間。
可參考的行動: 在你的團隊裡建一個「AI 提問實驗室」——不管是 Slack 頻道還是飛書群。規則很簡單:每個人每次用 AI 工具做出來的有意思的結果,都丟進來。不用解釋原理,只貼 prompt 和結果。堅持兩週,你會發現整個團隊的使用水平會同步提升。
💎 精華收穫
這集最大的啟發是:在 AI 時代做產品,你面對的不再是「用戶需求變化太快」,而是「模型能力本身會以你無法預測的方式跳躍」。傳統的產品規劃方法論在這種環境下會失效,你需要的是一套能持續偵測涌現能力的評估系統,加上一個能在 24 小時內把新能力變成上線體驗的組織體質。而這一切的基礎,是團隊成員之間在真正困難中建立起來的信任。