标签: LLM
包含该标签的全部文章 "LLM".
大模型并行的几种切法
DP、TP、PP、EP、CP 各自切什么?同样八张卡,DP=8、TP=8、DP=4 加 TP=2、DP=4 加 PP=2 有什么不同?从显存、通信、单请求延迟和总吞吐讲清多机多卡的取舍。
本地模型该用哪套运行时
先按硬件和并发把常见模型运行时分成表,再逐个说明它解决的问题。本机看 llama.cpp、Ollama、LM Studio、GPT4All、llamafile、TextGen、LocalAI 和 MLX;多请求服务看 vLLM、SGLang、TGI、TensorRT-LLM、LMDeploy 和 Xinference;超大混合专家模型看 KTransformers;多阶段音视频看 vLLM-Omni 和 SGLang-Omni。