L

LLMKube

Kubernetes 運算子,用於在異質 GPU 叢集上進行自架 LLM 推論:NVIDIA CUDA、AMD Vulkan 與 Apple Silicon Metal。執行環境:llama.cpp、vLLM、

LLMKube 是什麼?

Kubernetes 運算子,用於在異質 GPU 叢集上進行自架 LLM 推論:NVIDIA CUDA、AMD Vulkan 與 Apple Silicon Metal。執行環境:llama.cpp、vLLM、TGI、mlx-server。支援多 GPU 分片、模型快取、OpenAI 相容端點。Apache-2.0 授權,可在家庭實驗室與地端叢集執行,持續積極開發中。