All the articles with the tag "llm".
围绕 vLLM 与 Ray 的分布式容器化部署,整理 Kubernetes 编排、Ray Serve、张量并行、流水线并行、VRAM 分配和生产运维策略。
梳理本地大模型推理的核心瓶颈、量化格式选择、Ollama 的定位与限制,以及 vLLM、PagedAttention、连续批处理带来的吞吐优化。
梳理 vLLM 的核心架构、调度机制、PagedAttention 思路,以及 CPU 环境下的安装部署和基础使用方式。