Ollama
一行命令在本地跑起开源大模型,自带模型库与 OpenAI 兼容接口。
想把「AI 流程」先跑通、但暂时不想为 API 付费的人——尤其是草稿生成、批量改文案、本地知识库这类对前沿能力要求不高的活。
Ollama 做的事情只有一件:把「在本地跑一个开源大模型」压缩成一条命令。它把模型权重、推理参数、系统提示打包成一个 Modelfile,你执行 ollama run qwen2.5:7b,剩下的下载、加载、显存分配它全部处理完,交互式对话直接开始。
真正让它好用的是内置的那层 API。Ollama 启动后会在 localhost:11434 起一个服务,同时提供 /api/generate 原生接口和一套 OpenAI 兼容接口(/v1/chat/completions)。这意味着你现有的代码只要把 base_url 指过去、api_key 随便填,就能从云上模型切到本地模型,一行不改。
对一人公司来说,价值主要在成本结构:一次性的硬件投入换来每 token 零边际成本。批量跑几千条摘要、给客户做一个离线 demo、处理不能外传的数据,这些场景用云 API 要么贵要么不合规,本地跑反而更顺。
但它不是万能替代。7B/8B 级别的模型和前沿闭源模型在长链条推理、复杂指令跟随上差距明显,用来做最终质检或面向客户的核心输出要谨慎。合理的分工是:本地模型干量大、容错高的活,钱花在真正需要最强模型的那一小段。
能拿它做什么
- 批量处理:几千条评论打标签、旧文章重写、表格清洗,跑一晚上不花一分钱
- 敏感数据:合同、病历、内部文档不出本机
- 离线演示:给客户做私有化 demo,断网也能跑
- 开发降级:云 API 限流或涨价时有备用推理后端
怎么用起来
- 安装:macOS/Linux 用 curl -fsSL https://ollama.com/install.sh | sh,Windows 直接下安装包
- 拉模型:ollama run qwen2.5:7b(首次会下载权重,几 GB)
- 接应用:OpenAI SDK 的 base_url 填 http://localhost:11434/v1,api_key 填任意值即可
- 想固定系统提示和参数:写一个 Modelfile,ollama create my-model -f Modelfile
官网在 ollama.com ,源码在 GitHub 仓库 ↗。
坑在哪
自带的服务没有鉴权、没有队列、没有多租户,直接暴露到公网等于把自己的显卡借给别人用;要对外就必须套一层反向代理和限速。另外并发能力受单卡显存限制,两个人同时用就开始排队。小模型的能力边界也要提前试——先拿自己最难的 20 条样本压一遍,再决定放不放进生产。
一个人做产品时最省钱的方案:先把流程跑通,再决定要不要上云 API。