All the articles with the tag "vllm".
围绕 vLLM 与 Ray 的分布式容器化部署,整理 Kubernetes 编排、Ray Serve、张量并行、流水线并行、VRAM 分配和生产运维策略。
梳理本地大模型推理的核心瓶颈、量化格式选择、Ollama 的定位与限制,以及 vLLM、PagedAttention、连续批处理带来的吞吐优化。