Mac mini M4 pro 搭建本地大模型,文字对话、图片视频生成
机器型号:Apple M4 Pro 48GB 26.6.1 (25G76)
下面按“本机私有部署、稳定优先”编写。全部命令都在 Mac 的“终端”中执行。
最终组成:
- Ollama:运行文字模型
- Open WebUI:聊天、图片理解、文档知识库
- Draw Things:图片生成、图片编辑、视频生成
- ComfyUI:后续需要复杂工作流时再安装
一、检查机器和磁盘
uname -m
system_profiler SPHardwareDataType
df -h /
第一条应显示:
arm64
建议至少保留:
- 基础文字模型:40GB
- 图片模型:40~100GB
- 视频模型与生成文件:100GB以上
- 系统空闲空间:始终保留100GB左右
如果当前可用空间低于250GB,建议先准备雷电/USB4 NVMe固态硬盘。
二、安装Homebrew
先检查:
brew --version
如果提示找不到命令,安装Homebrew:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Apple Silicon机器安装完成后执行:
echo 'eval "$(/opt/homebrew/bin/brew shellenv)"' >> ~/.zprofile
eval "$(/opt/homebrew/bin/brew shellenv)"
验证:
brew --version
更新软件源:
brew update
三、安装Ollama
安装原生Ollama服务:
brew install ollama
启动并设置登录后自动运行:
brew services start ollama
检查状态:
brew services list
测试API:
curl http://127.0.0.1:11434/api/version
能看到版本JSON即为正常。Homebrew当前为Apple Silicon提供Ollama原生安装包,并包含MLX相关支持。Homebrew Ollama
不要同时安装ollama-app和Homebrew服务版,保留上面的服务版即可。
常用服务命令
brew services start ollama
brew services stop ollama
brew services restart ollama
如果服务启动失败,可以前台诊断:
brew services stop ollama
ollama serve
诊断结束按Control+C,再重新启动服务:
brew services start ollama
四、下载文字模型
1. 主力模型
ollama pull qwen3.6:35b-a3b
这个Q4_K_M模型约24GB,作为日常主力模型。Qwen3.6 35B-A3B
2. 快速模型
ollama pull qwen3.5:9b
该模型约6.6GB,用于快速问答、摘要和Open WebUI后台任务。Qwen3.5 9B
3. 知识库向量模型
ollama pull bge-m3
约1.2GB,支持中文、多语言文档检索。
4. 可选编程模型
如果需要给Continue、Cline、OpenCode等开发工具使用,再下载:
ollama pull qwen3-coder:30b
约19GB,不是必装。Qwen3.6本身也有较强编程能力。
5. 查看已下载模型
ollama list
预期至少出现:
qwen3.6:35b-a3b
qwen3.5:9b
bge-m3
6. 测试中文对话
ollama run qwen3.6:35b-a3b
进入后输入:
请用中文介绍你自己,并说明你是否能理解图片。
退出:
/bye
测试快速模型:
ollama run qwen3.5:9b
五、安装Open WebUI
安装桌面版:
brew install --cask open-webui
Homebrew提供Apple Silicon原生Open WebUI Desktop安装包。Open WebUI Homebrew
启动:
open -a "Open WebUI"
第一次启动时:
- 选择本地运行。
- 创建本机管理员账户。
- 这个账户只是本地Open WebUI账户,不需要注册云端服务。
- 第一个创建的账户自动成为管理员。
连接Ollama
进入:
Admin Settings
→ Connections
→ Ollama
填写:
http://127.0.0.1:11434
保存并刷新模型列表。
如果连接正常,应该看到:
- qwen3.6:35b-a3b
- qwen3.5:9b
- bge-m3
Open WebUI原生支持连接Ollama及OpenAI兼容接口。Open WebUI与Ollama
六、配置Open WebUI
1. 设置主模型
默认聊天模型:
qwen3.6:35b-a3b
后台任务模型:
qwen3.5:9b
后台任务包括标题生成、标签、搜索词整理等,不需要占用主力模型。
2. 设置上下文
进入:
Admin Settings
→ Models
→ qwen3.6:35b-a3b
→ Advanced Parameters
设置:
num_ctx = 32768
对qwen3.5:9b同样设置:
num_ctx = 32768
不要直接设置128K或256K。上下文越大,占用的统一内存越多。Open WebUI官方也建议根据硬件明确设置num_ctx。上下文设置说明
3. 配置文档知识库
进入管理设置中的Documents、Knowledge或RAG设置,具体菜单名称可能随版本略有变化。
设置:
Embedding Engine: Ollama
Ollama URL: http://127.0.0.1:11434
Embedding Model: bge-m3
建议参数:
Chunk Size: 1000
Chunk Overlap: 150
Top K: 5
完成后可以上传PDF、Markdown、Word或TXT文件进行本地问答。
4. 推荐开关
建议启用:
- Image Upload
- Vision
- Knowledge/RAG
- Context Compaction
- Native Tool Calling
如果可以设置压缩阈值,使用:
26000 tokens
这样对话接近32K时会先压缩旧内容,减少超出上下文的情况。
七、安装Draw Things
安装:
brew install --cask draw-things
启动:
open -a "Draw Things"
Homebrew当前提供macOS原生Draw Things版本。Draw Things Homebrew
第一次打开时:
- 允许创建模型与输出目录。
- 选择Local Compute。
- 云端账户可以跳过。
- 计算设备保持Automatic或GPU。
- 不要选择CPU Only。
八、下载图片模型
在Draw Things中进入模型管理页面,优先从Official Models下载,模型名称可能有少量版本后缀。
1. 快速生图模型
下载:
Z-Image Turbo
量化版本优先级:
6-bit或应用标记为Recommended的版本
用途:
- 快速测试提示词
- 写实人像
- 日常配图
- 批量生成草稿
首次使用不要自己更换Sampler,直接应用官方Recommended配置。
2. 主力高质量模型
下载:
FLUX.2 [klein] 4B
优先选择:
8-bit S / 8-bit / Recommended
如果没有上述版本,选择6-bit。
用途:
- 高质量文生图
- 参考图编辑
- 多图片参考
- 固定人物形象
- 海报和产品图
FLUX.2 Klein 4B支持生成、编辑和多参考输入,官方公布的运行显存约13GB。FLUX.2 Klein
3. 中文海报与编辑模型
可选下载:
Qwen Image
Qwen Image Edit
优先选择8-bit量化版本。
适合:
- 中文文字
- 海报
- 图片局部修改
- 人物换背景
- 保留主体进行多轮编辑
4. 推荐生图参数
初次测试:
分辨率:1024 × 1024
Batch Size:1
Seed:随机
Steps:使用Recommended
Sampler:使用Recommended
生成数量:1
确认稳定后再尝试:
1024 × 1536
1536 × 1024
不要一开始就使用2048像素和批量4张。
九、安装视频模型
在Draw Things模型管理中查找或导入:
Wan 2.2 TI2V 5B
优先选择:
5B
6-bit / 8-bit / Recommended量化版
Draw Things已支持Wan 2.2 5B模型和LoRA导入。Draw Things更新记录
推荐起步参数
模式:Image to Video
分辨率:768 × 448 或 832 × 480
时长:3~5秒
帧率:16fps
Batch Size:1
帧数:49~81
Tiled Decoding:开启
建议先生成一张满意的人物图片,再做图生视频。它通常比直接文生视频更容易保持人物一致性。
生成视频前释放文字模型
查看内存中的模型:
ollama ps
释放主模型:
ollama stop qwen3.6:35b-a3b
如果快速模型也在运行:
ollama stop qwen3.5:9b
Ollama默认会在闲置约5分钟后释放模型,也可以用ollama stop立即释放。Ollama模型内存管理
防止Mac在视频生成时休眠
打开一个新的终端窗口,执行:
caffeinate -dimsu
视频完成后按:
Control+C
十、可选安装ComfyUI
初期可以不装。只有需要以下功能时再安装:
- 节点式复杂工作流
- ControlNet
- 批量自动处理
- Open WebUI调用生图工作流
- 社区Wan工作流
- 更复杂的视频控制
从官方页面下载macOS Apple Silicon版:
安装步骤:
- 下载DMG。
- 拖入Applications。
- 启动Comfy Desktop。
- 创建一个Stable实例。
- 安装目录保持默认。
- 模型共享目录保持默认:
~/ComfyUI-Shared
- 后端应识别为:
MPS / Apple Silicon
在ComfyUI中进入:
Workflow
→ Browse Templates
→ Video
→ Wan 2.2 5B
先运行官方模板,不要一开始安装大量第三方节点。ComfyUI官方桌面版支持Apple Silicon和Metal/MPS。ComfyUI系统要求
十一、日常使用顺序
文字聊天
brew services start ollama
open -a "Open WebUI"
选择:
qwen3.6:35b-a3b
快速聊天
选择:
qwen3.5:9b
图片生成
ollama stop qwen3.6:35b-a3b
open -a "Draw Things"
视频生成
ollama stop qwen3.6:35b-a3b
ollama stop qwen3.5:9b
caffeinate -dimsu
然后在Draw Things中运行Wan 2.2。
十二、更新与维护
更新应用:
brew update
brew upgrade ollama
brew upgrade --cask open-webui draw-things
更新模型:
ollama pull qwen3.6:35b-a3b
ollama pull qwen3.5:9b
ollama pull bge-m3
查看模型:
ollama list
查看正在占用内存的模型:
ollama ps
删除不需要的模型:
ollama rm 模型名称
检查系统内存压力:
memory_pressure
查看内存占用:
top -o mem
十三、最终验收
依次执行:
brew services list
curl http://127.0.0.1:11434/api/version
ollama list
ollama ps
最终应达到:
- Ollama服务状态为
started - API能返回版本信息
- Open WebUI能显示Qwen模型
- Qwen3.6能正常中文对话
- Open WebUI能识别上传图片
- 知识库使用bge-m3
- Draw Things能生成1024×1024图片
- 释放Ollama后,Wan 2.2能生成480P短视频
目前先保持Ollama只监听127.0.0.1,不要把11434端口直接暴露到局域网或公网,因为Ollama接口本身没有用户登录保护。