最近文章
大模型常见术语解释
更新于:从模型与参数、Token 与上下文、生成速度与采样,到 API 计费、RAG、Agent 和微调,按使用场景解释大模型常见术语及容易混淆的概念。
RAG 与 LLM Wiki:两种 AI 知识库方式怎么选
RAG 在提问时检索资料,LLM Wiki 在资料进入时整理知识。用同一套文档解释两者的工作流程、失败原因、维护成本,以及什么时候应该结合使用。
大模型并行的几种切法
DP、TP、PP、EP、CP 各自切什么?同样八张卡,DP=8、TP=8、DP=4 加 TP=2、DP=4 加 PP=2 有什么不同?从显存、通信、单请求延迟和总吞吐讲清多机多卡的取舍。
本地模型该用哪套运行时
先按硬件和并发把常见模型运行时分成表,再逐个说明它解决的问题。本机看 llama.cpp、Ollama、LM Studio、GPT4All、llamafile、TextGen、LocalAI 和 MLX;多请求服务看 vLLM、SGLang、TGI、TensorRT-LLM、LMDeploy 和 Xinference;超大混合专家模型看 KTransformers;多阶段音视频看 vLLM-Omni 和 SGLang-Omni。
模型智能指数
分数越高表示综合能力越强。实心是闭源,空心是开放权重。数据取自Artificial Analysis在 2026-09-24 展示的当前模型,不是完整榜单。
Claude Opus 5.5
57.6
Claude Fable 5.1
53.4
GPT-6 Astra
52.7
Muse Spark 1.3
48.1
GPT-6 Sol
47.5
MiMo-V2.6-Pro
46.3
GLM-5.3
44.8
Kimi K3
43.6
GLM 5.3 Flash
41.8
DeepSeek V4.1 Flash
39.5