先建立边界
这个 Git 仓库不是完整训练平台,也不直接存放几十 GB 的权重。它是学习入口:告诉你模型是什么、权重去哪取、如何推理、部署、量化、微调和评测。
左侧用主流程解释 Qwen3 从训练、推理到部署评测的链路;右侧统一解释关键名词,按小白视角把概念先捞出来,再对应到仓库文件。
这个 Git 仓库不是完整训练平台,也不直接存放几十 GB 的权重。它是学习入口:告诉你模型是什么、权重去哪取、如何推理、部署、量化、微调和评测。
一次调用不是“直接问模型”。消息会经过 ChatML 模板、tokenizer、上下文窗口、decoder-only 模型、采样器,最后再被解析成普通回答、思考内容或工具调用。
Transformers 更适合理解原理和本地实验;vLLM/SGLang 更适合服务化;llama.cpp/Ollama/LM Studio 更适合低门槛本地运行。
要判断方案好不好,别只看主观回答。用 eval 目录的思路:固定数据集、固定服务接口、批量生成、规则解析、打分,再调整模型和参数。