Ollama cho Mac
Chạy AI cục bộ trên Mac — nền tảng cho mọi app AI offline
Tải nhanh từ kho Huy Store (bản mirror mã nguồn mở) hoặc nguồn gốc.Ảnh chụp màn hình


Giới thiệu
Ollama là cách phổ biến nhất hiện nay để chạy mô hình ngôn ngữ lớn (LLM) ngay trên máy Mac, không cần gửi dữ liệu lên mạng. Bạn chỉ cần chọn tên model — Qwen3, DeepSeek-R1 bản chưng cất, Gemma 3, Llama, gpt-oss… — Ollama tự tải về, nạp vào bộ nhớ và cho bạn trò chuyện. Các bản gần đây có sẵn cửa sổ chat, chỉnh được độ dài ngữ cảnh (context length), nên người không quen Terminal cũng dùng được.
Sức mạnh thật của Ollama nằm ở vai trò "động cơ": nó chạy ngầm trên thanh menu và mở API tại cổng 11434, nên các app giao diện như Open WebUI, Reins, Jan hay công cụ lập trình đều kết nối vào được. Tải model một lần, dùng từ nhiều app. Muốn cả nhà hoặc văn phòng dùng chung, bạn có thể cho máy khác trong mạng LAN truy cập theo hướng dẫn trong tài liệu chính thức.
Trên Mac chip M, Ollama dùng cả CPU và GPU nhờ Unified Memory, nên một chiếc Mac mini 32GB chạy được model mà PC phổ thông phải có card đồ hoạ đắt tiền. Theo tài liệu Ollama, cần macOS Sonoma (14) trở lên; Mac Intel vẫn cài được nhưng chỉ chạy bằng CPU nên rất chậm.
Giới hạn cần biết: model phải vừa RAM máy (8GB chỉ nên dùng model 3–4B, 16GB cho model 8B, 32GB cho model 14–27B), mỗi model nặng từ 1GB đến hàng chục GB ổ cứng, và dù chạy tốt đến đâu, model cỡ này vẫn kém ChatGPT bản cloud ở câu hỏi khó. Ollama là mã nguồn mở theo giấy phép MIT, miễn phí hoàn toàn khi chạy offline.
Tính năng nổi bật
Tải và chạy DeepSeek-R1, Qwen3, Gemma 3, Llama, gpt-oss ngay trên máy.
Chọn model, gõ câu hỏi; model chưa có sẽ tự tải về.
Dùng cả CPU và GPU trên Mac chip M nhờ Unified Memory.
Máy chủ nội bộ cổng 11434 để Open WebUI, Reins, Jan kết nối.
ollama run, ollama list, ollama ps, ollama rm để quản lý model.
Miễn phí, cập nhật rất thường xuyên trên GitHub.
Hướng dẫn cài đặt
- Tải Ollama.dmg tại ollama.com/download (hoặc nút tải của Huy Store)
- Mở file .dmg, kéo Ollama vào thư mục Applications
- Mở Ollama, đồng ý khi app xin tạo lệnh ollama trong /usr/local/bin (nhập mật khẩu máy)
- Chọn model trong cửa sổ chat hoặc gõ lệnh như ollama run qwen3:8b trong Terminal
- Xem hướng dẫn đầy đủ: memac.vn/bai-viet/cai-ollama-chay-ai-offline-tren-mac/
💡 Nếu macOS báo chặn "nhà phát triển không xác định", vào System Settings → Privacy & Security và bấm Open Anyway.
Câu hỏi thường gặp
Ollama dùng thế nào?
Mở app và chat trong cửa sổ Ollama, hoặc mở Terminal gõ ollama run tên-model (ví dụ qwen3:8b). Lần đầu model sẽ được tải về.
Mac bao nhiêu RAM thì chạy được Ollama?
8GB chạy được model nhỏ 3–4B; 16GB hợp model 8B; 32GB trở lên cho model 14–27B. Model càng lớn trả lời càng tốt nhưng càng cần nhiều RAM.
Model Ollama lưu ở đâu?
Theo tài liệu Ollama, model và cấu hình nằm trong thư mục ~/.ollama. Xoá model bằng lệnh ollama rm.
Ollama có miễn phí không?
Có, mã nguồn mở MIT. Chạy model offline không cần tài khoản.