获得出色的模型性能 借助 NVIDIA 和社区的加速引擎 (包括 TensorRT、TensorRT-LLM、vLLM、SGLang 等) 提高 AI 应用程序的性能和效率, ,这些引擎针对特定 NVIDIA GPU 系统上的低延迟、高吞吐量推理进行了预构建和优化, 更大限度地提高可操作性和规模 获取用于控制面板的详细可观察性指标,。
或利用 Hugging Face 上的专用端点在您首选的云中启动实例。
包括社区微调模型和基于数据微调的模型。
保持应用程序和数据的安全性和控制力, 随时随地运行 AI 模型 借助可部署在任何位置 (工作站、数据中心或云) 的 NVIDIA GPU 上的预构建微服务,下载用于自托管部署的 NIM 推理微服务, 在数千种 AI 模型与定制方案中自由选择 部署 vLLM、SGLang 或 TensorRT-LLM 支持的各种 LLM,并访问 Helm 图表和在 Kubernetes 上扩展 NIM 的指南。
