胡泽贤 律师RULES & BEYONDBEGINNER 08 / 2026

AI AGENT / 零基础前置 08

把模型放进自己的电脑,先从三个概念开始。

本地部署不是下载一个聊天软件这么简单,也不必从显卡和容器学起。先知道工具安装、模型下载、内存占用和运行服务分别在做什么。

Homebrew、Ollama、模型文件和聊天界面组成四层本地运行栈的编辑视觉
VISUAL METAPHOR / 主题隐喻本地运行栈 · 安装工具、下载模型、加载推理

Homebrew、CLI、Ollama、模型参数、量化、上下文窗口常在同一篇教程里突然出现,让第一次尝试本地 AI 的人以为必须先成为开发者。

其实第一步只需要分清三层:操作系统上的包管理器、负责推理的运行器,以及具体模型文件。每层都能独立检查和替换。

Homebrew 帮你安装工具,Ollama 帮你管理和运行模型;真正占空间与内存的,主要是你下载的模型。

01 / THREE LAYERSHomebrew 不是模型,Ollama 也不是模型。

Homebrew 是 macOS 与 Linux 常用的包管理器,像一个可以用命令搜索、安装、升级和卸载工具的软件商店。Ollama 是本地模型运行与管理工具。Qwen、DeepSeek-R1、Gemma 等才是被下载并运行的模型。

1

Homebrew

负责安装软件包;Apple Silicon Mac 默认前缀通常是 /opt/homebrew。

2

Ollama

负责下载、列出、启动和通过本地 API 调用模型。

3

模型文件

决定主要能力、磁盘体积与内存需求;不同参数和量化版本大小不同。

4

聊天界面

只是与本地 API 交互的前端,可用终端,也可另装图形界面。

02 / FIRST RUN第一次运行,实际发生了四件事。

先安装 Ollama,再选择一个适合机器的小模型;首次运行会把模型文件下载到本地;启动后模型被加载进内存;你输入文字,本机推理并逐 token 返回结果。Ollama 的本地 API 默认在 `http://localhost:11434/api`。

  • 先查系统和芯片:Apple Silicon、Intel、Windows 或 Linux。
  • 先看可用内存与磁盘,不要只看下载按钮。
  • 从较小量化模型开始,确认能跑、速度能接受,再尝试更大版本。
  • 下载完成不等于完全离线:界面、插件、更新与联网工具仍需单独检查。

03 / HARDWARE模型大小、内存和速度是一组取舍。

模型名里的 7B、14B、32B 常指参数规模;量化会用更少位数保存权重,显著减少磁盘与内存,但可能牺牲部分质量。运行时还要为上下文和中间计算留空间,所以一个 8GB 模型文件不等于 8GB 内存就一定流畅。

Mac 的统一内存会由 CPU 与 GPU 共享,适合个人本地推理;但更大模型、更长上下文和并行请求都会增加占用。选择时以实际模型页面、运行日志和可用内存为准。

本地模型不是免费云端旗舰:你把订阅费换成了硬件、时间、电力和维护。

04 / PRIVACY本地更可控,但不是自动安全。

模型推理留在本机,可以缩小数据外传范围;但你使用的桌面界面、插件、搜索工具、遥测、同步目录和备份仍可能联网。处理敏感资料时,要核对完整数据路径,而不是只确认模型来自本地。

学习来源与阅读边界

  • Homebrew Installation支持系统、默认前缀与安装后配置
  • Homebrew Manualformula、cask、install、list 与 uninstall
  • Ollama QuickstartmacOS、Windows、Linux 与第一次运行
  • Ollama API默认本地 API 地址与调用示例
  • Ollama Model Library模型标签、体积、上下文与运行命令
  • 《深入理解 AI Agent》开源仓库:十章工程主线与术语来源。
  • 本前置系列由本站为非技术读者补写,使用生活化例子降低入口门槛,不替代原书。
  • 不用访问 GitHub 也能在本站读完整内容并完成预编排互动;原始链接仅供想继续深挖的读者使用。

下一篇:Token、上下文和输出长度到底怎么算。

继续保持“先建立直觉,再补术语与工程细节”的顺序。

打开交互实验室 继续零基础路线

读者评论

把这篇文章留给你的想法写下来。

0 / 300

还没有评论。你可以留下第一条。