想把一個 Hugging Face 上的開源模型跑成生產級 API,但不想自己處理 GPU 選型、量化方式與 kernel 調校?RunInfra 的定位就是這件事:貼一個模型進去,它幫你把可能的組合跑過一輪 benchmark,挑出贏的那組,然後你可以直接部署,或把整套 stack 帶走自架。
這篇 RunInfra 教學會照官網與官方文件的實際內容走一遍:它到底做什麼、方案怎麼算、一次優化會產出什麼、以及 token 怎麼計價。
RunInfra 是什麼?
官網 hero 的一句話是「Optimize any Hugging Face model for production」,底下接著說明流程:貼一個模型,RunInfra 對各種選項做 benchmark 並挑出勝出的組合,你可以部署它,或者擁有整套 stack。公司標示為 RunInfra by RightNow,網站上也標示 Backed by Combinator。
它實際比較與調整的東西寫得相當具體。推論引擎方面會把 vLLM、SGLang、TensorRT-LLM、vLLM-Omni 等你的模型跑得起來的引擎放在一起比;調校面向包含 speculative decoding、kernel generation、server tuning、quantization、KV cache reuse、FlashAttention v2 與 continuous batching——官網的說法是「在有幫助的地方調」,而且不需要你手寫任何 config。部署目標涵蓋 NVIDIA H100、H200、B200、A100、L40S、L4。
這裡有一個對評估很重要的設計理念:官網強調 serving engine 是「compared, not assumed」(比較出來的,不是預設的)。同一頁列出每次優化會量到的東西:GPU target 依模型大小配置、p95 latency 實測、throughput 以每張 GPU 量、VRAM 檢查是否放得下、成本按每次執行追蹤,以及在支援的情況下調 GPU kernel。
事前準備:方案與免費額度
RunInfra 官方文件目前列出四級方案:Starter 免費、Pro 每月 49 美元、Team 每席每月 249 美元、Enterprise 客製報價。Starter 可建立、優化並在 playground 測試,但不能部署;部署需要 Pro 或更高方案。
Pro 每月包含 20 次 optimization sessions;Team 每席每月包含 100 次,超額 session 為 2.50 美元,未用完的 sessions 可累積。官方 changelog 也說明 Team 可使用 always-on 部署,Enterprise 則面向需要客製合約、合規或大量用量的組織。這套現行分級已取代本文舊版曾記載的 Core credit 制。
覺得有用?每天 5 分鐘掌握 AI 新工具
免費訂閱,新工具搶先看,隨時可取消
Step 1:描述你要的 endpoint
官網的操作起點是一個輸入框,問的是「What do you want to optimize?」,可以用 @ 挑模型。它給的示範工作負載也很能說明顆粒度:
- 「Find the best serving engine for Qwen 2.5 7B」(比較引擎)
- 「Optimize Qwen 2.5 7B for low latency」(調延遲)
- 「Deploy Whisper Large V3 Turbo with p95 and cost checks」(語音,帶 p95 與成本檢查)
- 「Build BGE-M3 embeddings with batch throughput metrics」(檢索,帶批次吞吐指標)
可以看出寫法的共同點:模型名稱 + 你真正在乎的指標(延遲、吞吐、成本),而不是「幫我優化一下」。
Step 2:讀 benchmark receipt,再決定部署或匯出
官網對產出的描述是:每次優化結束都會給你一份可以檢查、可以執行的結果——一份 benchmark receipt 加上一套可執行的 deployment kit,「Nothing hidden」。
這裡有兩條路:
- 直接部署:用 managed deploy 加 scale-to-zero endpoint,走 OpenAI 相容 API,按每百萬 token 計費。
- 匯出自架:把整套 stack 帶走自己跑。這是 Core 就包含的能力,官網把它寫成「your exit is free」——評估任何基礎設施服務時,這一條值得放在前面看。
Step 3:算清楚 token 成本
部署 endpoint 後採 per-token billing。官方文件沒有在目前可公開核對的方案頁提供一張適用所有模型的固定費率表;Deploy 畫面會依模型、量化、GPU 等級與部署模式顯示該設定的預估成本。因此本文刪除舊版的模型級距價格表,避免把已無法由現行文件重現的數字當成報價。
常見問題 FAQ
RunInfra 有免費方案嗎?要先聯繫業務嗎?
有。Starter 是免費方案,可建立、優化並在 playground 測試;要部署則需 Pro(每月 49 美元)或更高方案。Enterprise 才需要洽談客製條件。
各付費方案差在哪?
Pro 每月含 20 次 optimization sessions;Team 每席每月 249 美元、每席含 100 次 sessions,並提供 always-on 部署;Enterprise 為客製方案。超額 session 為 2.50 美元,未用額度可累積。
如果之後想搬走,會被綁住嗎?
官網把這點寫在 Core 的包含項目裡:每次優化都附 deployment kit,「your exit is free」。你可以匯出整套 stack 自架,Enterprise 另外支援自架與自訂 GPU 部署。
我的資料會被拿去訓練嗎?
官網頁尾標示四項:End-to-end encryption、Isolated GPU infrastructure、No training on your data、SOC 2 Type II。這些是官網頁尾列出的安全性主張;涉及實際保障範圍時仍應閱讀合約條款。
下一步
評估 RunInfra 最實際的做法,是先用 Starter 建立、優化並在 playground 測試你真正要上線的模型,把 benchmark receipt 打開來看:p95 延遲、每張 GPU 的吞吐、VRAM 是否放得下、每次執行的成本。這四個數字加起來,比任何一頁功能列表更能告訴你值不值得。
編按:本文方案資料更新至 2026 年 8 月 29 日,依 RunInfra 官方 changelog、部署與方案文件整理;服務條款仍以簽約頁面為準。
免責聲明:本文依官方公開資料整理撰寫,非合作推廣。工具品質與安全性請讀者自行評估,使用前建議查證官方最新資訊。
常見問題 FAQ
RunInfra 有免費方案嗎?要先聯繫業務嗎?▼
Core 和 Enterprise 差在哪?▼
之後想搬走會被綁住嗎?推論怎麼計價?▼
相關日報
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
延伸閱讀
Perplexity vs ChatGPT:2026 搜尋與對話 AI 工具比較
深入比較 Perplexity vs ChatGPT 2026 版本,分析 perplexity 和 chatgpt 差異,解答 perplexity 好用嗎,並提供最佳 ai 搜尋工具推薦與選擇建議。
Laya 開源模型Laya 開源決策模型中文實測:零樣本 53 題判斷題結果
Laya 是 Apache 2.0 的開源決策模型,不生成文字、只做選擇題。我們用 53 題中文長文判斷題零樣本實測,記錄結果、設定陷阱與使用建議。
Cyphral DistichAI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
ChatGPT 小型企業工具ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
資料來源:https://www.producthunt.com/products/runinfra
🤖 本指南由 AI 整理,功能、價格與規格請以官方網站為準。如有疑慮,請參閱編輯政策。
