Superhuman 導入 Auto-draft 功能,解析 LLM 郵件生成效率與應用體驗
文章摘要
郵件客戶端 Superhuman 推出升級版「Auto-draft」功能,旨在透過大語言模型(LLM)減輕收件匣負擔。該功能整合 Anthropic 與 OpenAI 等前端模型,能識別重要郵件並根據使用者過往語氣產出三種回應草稿,透過「個人化設定」導入背景資訊或職位說明,顯著解決過往 AI 回應過於生硬、缺乏個人特色的痛點。
數據顯示,測試階段有 40% 的自動草稿在當日內送出,其中 60% 無需任何人工編輯。此功能目標族群為處理大量郵件的專業人士,其核心意義在於將 AI 從簡單的自動回覆升級為具有上下文理解能力的溝通輔助,提升處理效率。目前該技術尚存缺陷,例如偶爾會誤判行程或給出過度積極的承諾,仍需使用者監控與篩選。未來 Superhuman 將進一步發展跨平台助手「Superhuman Go」,以強化跨應用的上下文銜接能力。
數據顯示,測試階段有 40% 的自動草稿在當日內送出,其中 60% 無需任何人工編輯。此功能目標族群為處理大量郵件的專業人士,其核心意義在於將 AI 從簡單的自動回覆升級為具有上下文理解能力的溝通輔助,提升處理效率。目前該技術尚存缺陷,例如偶爾會誤判行程或給出過度積極的承諾,仍需使用者監控與篩選。未來 Superhuman 將進一步發展跨平台助手「Superhuman Go」,以強化跨應用的上下文銜接能力。
AI 大叔解析
【新聞懶人包】
Superhuman 這次把 AI 自動草稿功能升級了,不再只是 GPT-3.5 這種老模型,而是直接拉滿,整合了 Anthropic 和 OpenAI 兩家頂級的「前沿模型」。新聞說新版草稿的語氣更自然,也能根據使用者習慣學習。據共同創辦人提供的數據,40% 的草稿能在一日內發送,其中 60% 甚至完全不用修改就寄出。這功能擺明是衝著像記者 Ivan 這種每月數千封信件的「重度使用者」來的,希望能幫他們從回信地獄中脫身,提高生產力。
【主戰場】
軟體工程與生產力
【真正主訊號】
LLM 在個人化情境的實用性提升/Beta 版用戶體驗與部分數據/新版自動草稿功能透過整合多個「前沿模型」(frontier models),在理解使用者語氣與提供實用回覆上,展現出比舊版 GPT-3.5 更好的表現,並有小規模測試數據支持其發送率與編輯率。
【以前卡哪?現在卡哪?】
以前的限制是「模型理解語境與生成語氣」能力不足,導致產出的草稿「聽起來像過於熱情的 AI 業務員」,讓使用者覺得修改成本太高,不愛用。現在透過整合「Anthropic 和 OpenAI 的前沿模型」,加上「從使用者習慣學習」的能力,讓語氣更自然、回覆更精準,將人工修改的需求降低到部分無需編輯的程度。
【真正關鍵】
個人化與上下文理解的進步/透過整合頂尖 LLM 模型,並加入使用者歷史對話語氣分析與即時回饋學習,大幅提升了 AI 郵件草稿的「情境理解能力」與「個人化語氣生成能力」,讓產出的回覆更貼近真人,減少人工修改需求。
【另外兩個重點】
1. **多模型整合策略:** Superhuman 並非單押寶一家 LLM 供應商,而是採取「混合模型」策略,同時使用 Anthropic 和 OpenAI 的「前沿模型」。這顯示他們在追求最佳生成品質時,願意投入更高的整合複雜度與相應的成本,而不只是追求單一供應商的便宜方案。
2. **用戶反饋循環與自學習:** 功能設計納入用戶使用後的反饋學習機制,例如文中提到「午夜會議災難」後,模型就能自動修正類似時間的回覆偏好。這種持續學習與優化的機制,對於提升 AI 輔助工具的「長期可用性」與「用戶信任度」至關重要。
【重要程度】
★★★☆☆
【毒舌吐槽】
「40% 的自動生成草稿在一天內發送,其中 60% 未經手動編輯。」這個數字很有趣。仔細算一下,也就是說,實際上未經編輯就被發送的草稿,只佔總生成數的 24%(40% x 60%)。這跟「大部分草稿不用改」的印象,感覺還是有點落差。Beta 版的數據,通常都有點「實驗室甜度」,實際大規模推出去之後,搞不好連 20% 都守不住。至於說什麼「最大化智能與上下文」,不就是把市面上最貴、最強的模型全部搬過來用,然後把整合的苦都吞了嗎?把別人的「前沿模型」包裝成自己的「最大化智能」,這種 PR 用語說實在的,就跟每次聽到「提升效率」、「改善體驗」這種空話沒兩樣,聽聽就好。
【為什麼重要?】
* **系統影響:** 這次 Superhuman 在「電子郵件自動草稿」這塊,確實展示了 LLM 在特定應用場景下的實用性提升。過去很多 AI 草稿功能都像機器人,語氣生硬、內容制式,使用者需要花更多時間大幅修改才能用。現在透過整合 Anthropic 和 OpenAI 的「前沿模型」,加上學習用戶個人語氣的能力,讓 AI 輔助回覆從「雞肋」變成「可能有點用」。這表示在強調個性化溝通的應用情境下,LLM 的「語氣模仿」和「上下文理解」能力已經達到一個可以稍微放心的門檻,不再只是詞藻華麗但欠缺靈魂的文本生成器。
* **成本或能力變化:** 新聞雖然沒提具體成本,但從 GPT-3.5 升級到「Anthropic 和 OpenAI 的前沿模型」,光是推論(Inference)階段的 API 費用可能就是數倍甚至數十倍的跳增。這些「前沿模型」的 Latency(延遲)和 Token 費用通常更高,這會直接影響 Superhuman 的服務訂閱價格與邊際成本。但相對的,能力上則大幅提升了產出草稿的自然度與精準度,讓使用者「無需編輯」的比例提高。共同創辦人提到的「40% 在一天內發送,其中 60% 不需編輯」,雖然整體看只有 24% 的草稿完全自動化,但這 24% 的自動化對於像新聞中提到每月處理「數千封」郵件的「苦主」來說,省下的時間成本是很有感的。以前 AI 草稿可能還要多花時間修改,現在至少有一部分能直接寄出,減少了思考和打字的時間,這對生產力提升是實實在在的。
* **苦主與爽主:**
* **苦主:** 像新聞中的記者 Ivan 這樣每月收到「數千封」郵件的專業人士,每天要花大量時間回覆。現在有了更精準、語氣更像自己的 AI 草稿,可以省下「打字和思考」回覆的時間,尤其是一些重複性高或只需簡短確認的郵件。
* **爽主:** Superhuman 自己肯定是爽主。他們透過整合頂級模型,提升了產品體驗,讓其訂閱服務更有吸引力,可以收取更高的費用。而 Anthropic 和 OpenAI 這些 LLM 供應商,也樂見他們的模型被實際應用,並且透過 Superhuman 增加了 API 服務的消費量。
【實戰建議】
對於在內部系統或 SaaS 產品中考慮導入生成式 AI 文本功能的產品經理,應仔細評估使用「前沿模型」的總體擁有成本(TCO),而不是只看單次 API 費用,尤其要考慮到推論延遲(Latency)對使用者體驗的影響,並確保具備有效收集使用者反饋並持續優化模型輸出的機制。
【一句話總結】
Superhuman 新版 AI 郵件草稿透過整合頂尖 LLM,顯著提升個人化語氣與效率,但高昂的成本與實際完全自動化比例,仍值得觀察。
【逆風觀點】
新聞中提到「By default, it often generated a positive response to a pitch, or agreed to a meeting at a post-midnight time」。這顯示了即使是「前沿模型」,在缺乏足夠個人化預設或強規則約束下,仍可能生成出「不符合真實意圖」的、甚至是有害的(比如同意半夜開會)回應。這強調了在任何 AI 自動化決策系統中,人類的「最終審核權」和「快速修正」機制依然不可或缺,完全放手給 AI 處理信箱,目前的技術能力還是不可行,連作者自己都說「不完全信任 AI 處理信箱」。
Superhuman 這次把 AI 自動草稿功能升級了,不再只是 GPT-3.5 這種老模型,而是直接拉滿,整合了 Anthropic 和 OpenAI 兩家頂級的「前沿模型」。新聞說新版草稿的語氣更自然,也能根據使用者習慣學習。據共同創辦人提供的數據,40% 的草稿能在一日內發送,其中 60% 甚至完全不用修改就寄出。這功能擺明是衝著像記者 Ivan 這種每月數千封信件的「重度使用者」來的,希望能幫他們從回信地獄中脫身,提高生產力。
【主戰場】
軟體工程與生產力
【真正主訊號】
LLM 在個人化情境的實用性提升/Beta 版用戶體驗與部分數據/新版自動草稿功能透過整合多個「前沿模型」(frontier models),在理解使用者語氣與提供實用回覆上,展現出比舊版 GPT-3.5 更好的表現,並有小規模測試數據支持其發送率與編輯率。
【以前卡哪?現在卡哪?】
以前的限制是「模型理解語境與生成語氣」能力不足,導致產出的草稿「聽起來像過於熱情的 AI 業務員」,讓使用者覺得修改成本太高,不愛用。現在透過整合「Anthropic 和 OpenAI 的前沿模型」,加上「從使用者習慣學習」的能力,讓語氣更自然、回覆更精準,將人工修改的需求降低到部分無需編輯的程度。
【真正關鍵】
個人化與上下文理解的進步/透過整合頂尖 LLM 模型,並加入使用者歷史對話語氣分析與即時回饋學習,大幅提升了 AI 郵件草稿的「情境理解能力」與「個人化語氣生成能力」,讓產出的回覆更貼近真人,減少人工修改需求。
【另外兩個重點】
1. **多模型整合策略:** Superhuman 並非單押寶一家 LLM 供應商,而是採取「混合模型」策略,同時使用 Anthropic 和 OpenAI 的「前沿模型」。這顯示他們在追求最佳生成品質時,願意投入更高的整合複雜度與相應的成本,而不只是追求單一供應商的便宜方案。
2. **用戶反饋循環與自學習:** 功能設計納入用戶使用後的反饋學習機制,例如文中提到「午夜會議災難」後,模型就能自動修正類似時間的回覆偏好。這種持續學習與優化的機制,對於提升 AI 輔助工具的「長期可用性」與「用戶信任度」至關重要。
【重要程度】
★★★☆☆
【毒舌吐槽】
「40% 的自動生成草稿在一天內發送,其中 60% 未經手動編輯。」這個數字很有趣。仔細算一下,也就是說,實際上未經編輯就被發送的草稿,只佔總生成數的 24%(40% x 60%)。這跟「大部分草稿不用改」的印象,感覺還是有點落差。Beta 版的數據,通常都有點「實驗室甜度」,實際大規模推出去之後,搞不好連 20% 都守不住。至於說什麼「最大化智能與上下文」,不就是把市面上最貴、最強的模型全部搬過來用,然後把整合的苦都吞了嗎?把別人的「前沿模型」包裝成自己的「最大化智能」,這種 PR 用語說實在的,就跟每次聽到「提升效率」、「改善體驗」這種空話沒兩樣,聽聽就好。
【為什麼重要?】
* **系統影響:** 這次 Superhuman 在「電子郵件自動草稿」這塊,確實展示了 LLM 在特定應用場景下的實用性提升。過去很多 AI 草稿功能都像機器人,語氣生硬、內容制式,使用者需要花更多時間大幅修改才能用。現在透過整合 Anthropic 和 OpenAI 的「前沿模型」,加上學習用戶個人語氣的能力,讓 AI 輔助回覆從「雞肋」變成「可能有點用」。這表示在強調個性化溝通的應用情境下,LLM 的「語氣模仿」和「上下文理解」能力已經達到一個可以稍微放心的門檻,不再只是詞藻華麗但欠缺靈魂的文本生成器。
* **成本或能力變化:** 新聞雖然沒提具體成本,但從 GPT-3.5 升級到「Anthropic 和 OpenAI 的前沿模型」,光是推論(Inference)階段的 API 費用可能就是數倍甚至數十倍的跳增。這些「前沿模型」的 Latency(延遲)和 Token 費用通常更高,這會直接影響 Superhuman 的服務訂閱價格與邊際成本。但相對的,能力上則大幅提升了產出草稿的自然度與精準度,讓使用者「無需編輯」的比例提高。共同創辦人提到的「40% 在一天內發送,其中 60% 不需編輯」,雖然整體看只有 24% 的草稿完全自動化,但這 24% 的自動化對於像新聞中提到每月處理「數千封」郵件的「苦主」來說,省下的時間成本是很有感的。以前 AI 草稿可能還要多花時間修改,現在至少有一部分能直接寄出,減少了思考和打字的時間,這對生產力提升是實實在在的。
* **苦主與爽主:**
* **苦主:** 像新聞中的記者 Ivan 這樣每月收到「數千封」郵件的專業人士,每天要花大量時間回覆。現在有了更精準、語氣更像自己的 AI 草稿,可以省下「打字和思考」回覆的時間,尤其是一些重複性高或只需簡短確認的郵件。
* **爽主:** Superhuman 自己肯定是爽主。他們透過整合頂級模型,提升了產品體驗,讓其訂閱服務更有吸引力,可以收取更高的費用。而 Anthropic 和 OpenAI 這些 LLM 供應商,也樂見他們的模型被實際應用,並且透過 Superhuman 增加了 API 服務的消費量。
【實戰建議】
對於在內部系統或 SaaS 產品中考慮導入生成式 AI 文本功能的產品經理,應仔細評估使用「前沿模型」的總體擁有成本(TCO),而不是只看單次 API 費用,尤其要考慮到推論延遲(Latency)對使用者體驗的影響,並確保具備有效收集使用者反饋並持續優化模型輸出的機制。
【一句話總結】
Superhuman 新版 AI 郵件草稿透過整合頂尖 LLM,顯著提升個人化語氣與效率,但高昂的成本與實際完全自動化比例,仍值得觀察。
【逆風觀點】
新聞中提到「By default, it often generated a positive response to a pitch, or agreed to a meeting at a post-midnight time」。這顯示了即使是「前沿模型」,在缺乏足夠個人化預設或強規則約束下,仍可能生成出「不符合真實意圖」的、甚至是有害的(比如同意半夜開會)回應。這強調了在任何 AI 自動化決策系統中,人類的「最終審核權」和「快速修正」機制依然不可或缺,完全放手給 AI 處理信箱,目前的技術能力還是不可行,連作者自己都說「不完全信任 AI 處理信箱」。