用 Python + Transformers 三步跑通一个开源模型:从安装到写出第一行推理代码
为什么不用现成软件
Ollama、LM Studio 这类工具上手快,但如果你想把模型塞进自己的程序、做批量处理或接业务系统,最终还是得写代码。Hugging Face 的 Transformers 库是绕不开的那一层,本文用最简路径把它跑起来。
第一步:装好环境
建议用虚拟环境隔离依赖,避免污染系统 Python:
- 创建并进入环境:
python -m venv venv && source venv/bin/activate - 安装核心库:
pip install transformers torch(torch 体积大,耐心等) - 验证:
python -c "import transformers; print(transformers.__version__)"能打印版本号即成功
第二步:选一个模型
去 huggingface.co 搜一个中小模型,新手推荐 Qwen/Qwen2.5-0.5B-Instruct 或 google/gemma-2-2b-it,体积小、消费级显卡甚至纯 CPU 都能跑。第一次运行会自动下载权重,记得联网。
第三步:写推理代码
新建 infer.py,粘贴下面几行:
from transformers import pipelinepipe = pipeline("text-generation", model="Qwen/Qwen2.5-0.5B-Instruct")out = pipe("用一句话解释什么是上下文窗口", max_new_tokens=128)print(out[0]["generated_text"])
运行 python infer.py,看到模型吐出中文回答,就完成了从零到跑通。之后把 model 换成更大的模型、把输入换成你的业务文本,就能接进实际流程。
踩坑提醒
CPU 跑大模型会很慢,先用 0.5B 级别验证流程;显存不够就加 device_map="auto" 让库自动分配。报缺少某个包,基本都是 pip install 对应名字即可。这三条命令打通后,你手里就有了一个能编程调用的模型入口。
文章版权声明:除非注明,否则均为开源技术之家原创文章,转载或复制请以超链接形式并注明出处。



还没有评论,来说两句吧...