071 · 從租用到自建的推論基礎設施
創辦人自曝推論費用一路燒到失控,再用三個企業案例說明企業何時該停止租用、自己蓋基礎設施。
原標題:Stop Renting Your Cognitive Infrastructure - Thiyagarajan Maruthavanan, Kalmantic Labs
重點摘要
- 推論帳單像賭場籌碼租用型 AI 推論用預付額度計費,沒有手機月租帳單那種心理錨點,讓人越用越上癮,直到某天才發現早就超支。
- 自身踩雷經驗講者做的音樂反推 App Ultrasono 爆紅後,推論成本燒到數十萬美元,三週前 API key 還被盜用,一路燒到一萬美元才擋下。
- 自建推論不是萬靈丹改用開源模型自建 GPU 能壓低成本,租用與自建之外的這條路對個人可行,但可靠度撐不起企業級需求。
- 三個企業各自撞牆基金要自己掌控 rate limit、醫院被稽核擋掉第三方供應商依賴、稅務事務所需要能解釋模型建議的來源,三種需求都逼企業自建。
- 自建時機看有沒有 PMF還在找 product market fit 的新創可以先用租的,一旦已經編列預算、確認有 PMF,就該自建基礎設施。
- 開源出 JustTokenMax把自建推論的經驗整理成 JustInfer 框架,token 與 context 管理的部分開源成 JustTokenMax,號稱優於 Netflix 的 headroom。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 推論帳單失控的痛點 | 用零售商砸兩億美元、Uber 一年 token 預算四個月燒完的例子開場,點出租用智慧的成本正在失控。 |
| 00:31 | 租用推論像賭場 | 推論用預付額度計費,沒有手機月租帳單那種心理錨點,用起來反而更容易不知不覺超支。 |
| 01:03 | Ultrasono 燒錢實錄 | 自己做的音樂反推 App Ultrasono 爆紅後,推論成本燒到數十萬美元,還碰過 API key 被盜用一路燒到一萬美元。 |
| 02:33 | Token Factory 路線 | 開源模型加自建 GPU 能壓低成本,這是租用之外的另一個選項,甚至有人主張在自家車庫組裝 GPU。 |
| 03:37 | 企業端各自撞牆 | 基金要掌控 rate limit、醫院被稽核擋掉第三方供應商依賴、稅務事務所需要能解釋模型建議的來源,租賃模式在三種情境都行不通。 |
| 04:46 | 自建時機的判準 | 還在找 PMF 的新創可以先租,一旦編列了預算、確認有 PMF,企業就不能再逃避自建基礎設施。 |
| 05:22 | 租房買房比喻 | 用搬進新城市先租房、最終要買房成家的比喻,說明自己從租用走向自建的心境轉折。 |
| 05:53 | JustInfer 與 JustTokenMax | 把自建推論的經驗整理成 JustInfer 框架,並把 token 與 context 管理的部分開源成 JustTokenMax。 |
| 07:00 | 市場太吵,自己找答案 | AI 推論市場規則每三到六個月就變一次,業界大老意見互相打架,最終還是要自己找出答案。 |
值得記的話
名詞與人物
| Ultrasono | 講者自己開發的 App,讓使用者輸入一首歌反推出可能生成它的文字提示,做法跟 Suno.com 相反。 |
|---|---|
| Suno.com | 把文字提示轉成一首完整歌曲的音樂生成服務。 |
| Token Factory | 用開源模型自建、以 token 或 GPU 產能計費的推論方式,是租用 Anthropic、OpenAI 這類服務之外的另一條路。 |
| neocloud | 專門提供 GPU 算力與推論產能的新型雲端供應商。 |
| DGX Spark | 講者用來自建本地推論的機器,提到跑的時候遇到記憶體容量是瓶頸,後來拿來跑自己研究室要用的 agent。 |
| JustInfer | 講者把自建推論基礎設施的經驗整理成的框架名稱。 |
| JustTokenMax | 講者開源的 token 與 context 管理專案,拿來跟 Netflix 的 headroom 比較效能。 |
| Headroom | Netflix 開源的 token 管理專案,被講者拿來當作 JustTokenMax 的效能比較基準。 |
延伸
- Uber CTO 曾公開提到一年份的 token 預算在第四個月就用完,講者拿來當開場例子,但沒有進一步說明細節。
- 業界對 AI 推論走向意見不一:講者提到 Jensen 認為 token factory 會是未來、Satya Nadella 的說法是 unmetered,只是點出立場分歧,沒有進一步展開。
- 稅務事務所案例裡,模型生成的建議無法追溯到內部邏輯的問題,講者只點出現象,沒有說明後續怎麼解決。