Mới MacCheck kiểm tra Mac cũ · Mac Khoẻ chăm máy 1 chạm. Tải app từ HuyStore
Ollama

Ollama cho Mac

Chạy AI cục bộ trên Mac — nền tảng cho mọi app AI offline

Tải nhanh từ kho Huy Store (bản mirror mã nguồn mở) hoặc nguồn gốc.
Giấy phépMã nguồn mở
NhómMedia & Sáng tạo
Nhà phát triểnollama.com
Nền tảngmacOS

Ảnh chụp màn hình

Cửa sổ chat của app Ollama trên macOS. (Ảnh: Ollama)
Cửa sổ chat của app Ollama trên macOS. (Ảnh: Ollama)
Biểu tượng Ollama. (Ảnh: Ollama)
Biểu tượng Ollama. (Ảnh: Ollama)

Giới thiệu

Ollama là cách phổ biến nhất hiện nay để chạy mô hình ngôn ngữ lớn (LLM) ngay trên máy Mac, không cần gửi dữ liệu lên mạng. Bạn chỉ cần chọn tên model — Qwen3, DeepSeek-R1 bản chưng cất, Gemma 3, Llama, gpt-oss… — Ollama tự tải về, nạp vào bộ nhớ và cho bạn trò chuyện. Các bản gần đây có sẵn cửa sổ chat, chỉnh được độ dài ngữ cảnh (context length), nên người không quen Terminal cũng dùng được.

Sức mạnh thật của Ollama nằm ở vai trò "động cơ": nó chạy ngầm trên thanh menu và mở API tại cổng 11434, nên các app giao diện như Open WebUI, Reins, Jan hay công cụ lập trình đều kết nối vào được. Tải model một lần, dùng từ nhiều app. Muốn cả nhà hoặc văn phòng dùng chung, bạn có thể cho máy khác trong mạng LAN truy cập theo hướng dẫn trong tài liệu chính thức.

Trên Mac chip M, Ollama dùng cả CPU và GPU nhờ Unified Memory, nên một chiếc Mac mini 32GB chạy được model mà PC phổ thông phải có card đồ hoạ đắt tiền. Theo tài liệu Ollama, cần macOS Sonoma (14) trở lên; Mac Intel vẫn cài được nhưng chỉ chạy bằng CPU nên rất chậm.

Giới hạn cần biết: model phải vừa RAM máy (8GB chỉ nên dùng model 3–4B, 16GB cho model 8B, 32GB cho model 14–27B), mỗi model nặng từ 1GB đến hàng chục GB ổ cứng, và dù chạy tốt đến đâu, model cỡ này vẫn kém ChatGPT bản cloud ở câu hỏi khó. Ollama là mã nguồn mở theo giấy phép MIT, miễn phí hoàn toàn khi chạy offline.

Tính năng nổi bật

Chạy LLM offline

Tải và chạy DeepSeek-R1, Qwen3, Gemma 3, Llama, gpt-oss ngay trên máy.

Cửa sổ chat có sẵn

Chọn model, gõ câu hỏi; model chưa có sẽ tự tải về.

Tận dụng Apple Silicon

Dùng cả CPU và GPU trên Mac chip M nhờ Unified Memory.

API cho app khác

Máy chủ nội bộ cổng 11434 để Open WebUI, Reins, Jan kết nối.

Lệnh Terminal đơn giản

ollama run, ollama list, ollama ps, ollama rm để quản lý model.

Mã nguồn mở MIT

Miễn phí, cập nhật rất thường xuyên trên GitHub.

Hướng dẫn cài đặt

  1. Tải Ollama.dmg tại ollama.com/download (hoặc nút tải của Huy Store)
  2. Mở file .dmg, kéo Ollama vào thư mục Applications
  3. Mở Ollama, đồng ý khi app xin tạo lệnh ollama trong /usr/local/bin (nhập mật khẩu máy)
  4. Chọn model trong cửa sổ chat hoặc gõ lệnh như ollama run qwen3:8b trong Terminal
  5. Xem hướng dẫn đầy đủ: memac.vn/bai-viet/cai-ollama-chay-ai-offline-tren-mac/

💡 Nếu macOS báo chặn "nhà phát triển không xác định", vào System Settings → Privacy & Security và bấm Open Anyway.

Ollama
Tải OllamaMã nguồn mở · macOS
Nhận

Câu hỏi thường gặp

Ollama dùng thế nào?

Mở app và chat trong cửa sổ Ollama, hoặc mở Terminal gõ ollama run tên-model (ví dụ qwen3:8b). Lần đầu model sẽ được tải về.

Mac bao nhiêu RAM thì chạy được Ollama?

8GB chạy được model nhỏ 3–4B; 16GB hợp model 8B; 32GB trở lên cho model 14–27B. Model càng lớn trả lời càng tốt nhưng càng cần nhiều RAM.

Model Ollama lưu ở đâu?

Theo tài liệu Ollama, model và cấu hình nằm trong thư mục ~/.ollama. Xoá model bằng lệnh ollama rm.

Ollama có miễn phí không?

Có, mã nguồn mở MIT. Chạy model offline không cần tài khoản.

Chia sẻ:
Facebook Messenger 𝕏
Zalo 0862 838 663