一句話結論
當資料不能出境、要可審計、或高頻推理成本高於自建臨界點時,應評估本地/私有 AI。
決策矩陣
- 含 PII/醫療/金融原始資料 → 優先私有
- 只需公開知識摘要 → 公有 API 通常足夠
- 需要穩定延遲的現場裝置 → 邊緣/本地推理
- 月 token 費用持續高於 GPU 總擁有成本 → 評估自建
最小可行本地架構
- 開源或商用模型運行時(vLLM / Ollama / TensorRT-LLM)
- 閘道 API(鉴權、配額、稽核)
- RAG:文件解析 + 向量庫 + 權限過濾
- 觀測:延遲、拒答率、幻覺抽樣