本地跑起你自己的大模型:Ollama 从安装到第一个聊天脚本
为什么要在本地跑模型
把数据传到云端总有顾虑,本地模型离线可用、隐私不出机。Ollama 让这件事从「配环境一整天」变成「三条命令」。
第一步:安装
macOS 和 Linux 直接执行:curl -fsSL https://ollama.com/install.sh | sh。Windows 去官网下安装包。装完终端输入 ollama --version,能看到版本号就成功了。
第二步:拉一个模型
新手先从 qwen2.5:7b 起手,体积适中、中文不错:ollama pull qwen2.5:7b。拉完用 ollama run qwen2.5:7b 直接进对话,敲完问题回车就能聊。
第三步:写第一个脚本
不想开命令行聊天,就用 Python 调接口。Ollama 自带本地接口,默认在 11434 端口:
- 安装请求库:
pip install requests - 发一条消息:POST 到
http://localhost:11434/api/chat,body 里带 model 和 messages 数组。 - 拿到回复里的 content 字段,就是模型的话。
这样一个最小聊天脚本不到 20 行,跑通后你就可以把它接进自己的工具里,比如定时总结日志、自动给工单分类。
踩坑提醒
7b 模型吃内存,8G 内存的机器会卡;真要流畅至少 16G。如果拉模型慢,换个网络时段再试,别反复强拉。
文章版权声明:除非注明,否则均为开源技术之家原创文章,转载或复制请以超链接形式并注明出处。



还没有评论,来说两句吧...