文章
我发布的全部文章。
大模型常见术语解释
更新于:从模型与参数、Token 与上下文、生成速度与采样,到 API 计费、RAG、Agent 和微调,按使用场景解释大模型常见术语及容易混淆的概念。
RAG 与 LLM Wiki:两种 AI 知识库方式怎么选
RAG 在提问时检索资料,LLM Wiki 在资料进入时整理知识。用同一套文档解释两者的工作流程、失败原因、维护成本,以及什么时候应该结合使用。
大模型并行的几种切法
DP、TP、PP、EP、CP 各自切什么?同样八张卡,DP=8、TP=8、DP=4 加 TP=2、DP=4 加 PP=2 有什么不同?从显存、通信、单请求延迟和总吞吐讲清多机多卡的取舍。
本地模型该用哪套运行时
先按硬件和并发把常见模型运行时分成表,再逐个说明它解决的问题。本机看 llama.cpp、Ollama、LM Studio、GPT4All、llamafile、TextGen、LocalAI 和 MLX;多请求服务看 vLLM、SGLang、TGI、TensorRT-LLM、LMDeploy 和 Xinference;超大混合专家模型看 KTransformers;多阶段音视频看 vLLM-Omni 和 SGLang-Omni。