Tokenless 是一個 API 路由器服務,能同時執行多個 AI 模型並選擇最高效的模型,藉此將 AI 營運成本降低最高 57%。
想像一下:您每天早上請 AI 秘書整理工作事項並撰寫郵件草稿。但如果每次處理這些簡單任務時,您都呼叫了世界頂尖、非常昂貴的「博士級」AI 模型,那會如何呢?事實上,這可能就像是為了讓十歲小孩也能做的事,支付了博士級的高薪。
最近,在矽谷新創加速器 YC (Y Combinator) S26 梯次中誕生的「Tokenless」為了解決這個問題而出現。他們找到了一種非常聰明的方法,能協助企業降低在使用 AI 時日益增加的成本負擔。
這為什麼很重要?
隨著 AI 技術的進步,效能雖有驚人提升,但營運成本也呈現天文數字般的成長。據悉,連 Uber 或 Salesforce 等巨頭企業,也因為 AI 成本消耗速度遠超預期而感到頭痛。出處: Hacker News
對開發者而言,高效能的「前沿模型 (Frontier Model,指現今效能最強的尖端 AI 模型)」極具吸引力,但因成本考量,要將其用於所有任務實屬困難。反之,效能較低的模型成本較低,卻不足以處理複雜任務。Tokenless 正是為您解決這項「效能」與「成本」之間平衡難題的服務。出處: Hacker News
輕鬆理解:聰明主廚的故事
讓我們換個比喻。假設您需要完成一道複雜的料理食譜,而廚房裡有三位廚師:一位是米其林三星主廚、一位是普通餐廳廚師,還有一位是剛開始學習廚藝的學徒。
Tokenless 就像是一位「聰明的主廚」。當您下達料理訂單時,這位主廚會讓所有廚師同時開始作業。但在觀察料理製作過程後,他確認普通餐廳廚師已完全理解食譜並能完美執行任務。此時,他會立即指示三星主廚與學徒停止工作,並只支付材料費給那位普通餐廳廚師。
在技術層面上,Tokenless 是一個將此過程自動化的「隨插即用 (Drop-in,可直接嵌入既有環境)」API 路由器。[出處: 出處標題] 它會將使用者的請求同時發送給多個模型,在選擇出最快或最合適的回答模型後,立即取消其餘模型。[出處: 出處標題] 結果就是,使用者只需支付實際需要的費用。
目前進展如何?
Tokenless 目前提供與 OpenAI 和 Anthropic API 相容的端點,讓開發者無需調整任何設定即可直接使用。[出處: 出處標題] 對於已經在使用 AI 模型的企業來說,無需修改複雜程式碼,只需透過 Tokenless 更改服務連接,即可預期立即獲得成本節省的效果。
據該團隊宣稱,透過這種自動模型切換 (Model Switching) 技術,最高可將 AI 推論成本降低 57%。[出處: 出處標題]
未來發展?
AI 技術的發展速度極快,開源 (Open Source) 模型也在迅速提升效能,不斷縮小與前沿模型之間的差距。出處: Hacker News 若 Tokenless 這類的優化工具普及,開發者將不再受限於單一模型,而是能根據每天的工作性質與預算,構成最合理的 AI 組合。
當成本負擔降低,更多因預算考量而遲遲未實踐的創意,將有機會轉化為實際服務問世。技術不僅僅是在變聰明,現在更開始變得「更經濟地」聰明。
MindTickleBytes 的 AI 記者觀點
在 AI 服務的商業化過程中,最大的障礙往往不是效能而是成本。Tokenless 展示了一種以軟體方式解決基礎設施低效率的聰明途徑。若未來此類技術更加普及,AI 將能更無負擔地深入我們生活的各個角落。
參考資料
- Launch HN: Tokenless (YC S26) – Automatic model switching to save money URL: https://wpnews.pro/news/launch-hn-tokenless-yc-s26-automatic-model-switching-to-save-money
- Tokenless launches automatic AI model switching to cut costs… URL: https://pulseaugur.com/cluster/170907-tokenless-launches-automatic-ai-model-switching-to-cut-costs
- Tokenless | The router that cuts your inference bill in half URL: https://usetokenless.com/
- Launch HN: Tokenless (YC S26) – Automatic model switching to save money | Hacker News URL: https://news.ycombinator.com/item?id=49099143
- 優化模型的數據中心位置
- 同時執行多個模型,確認最合適的模型後取消其餘模型
- 強行減少 AI 模型的參數數量
- 30%
- 45%
- 57%
- 提供與 OpenAI 和 Anthropic 相容的端點
- 僅支援 Google 模型
- 僅能使用自家開發的模型