# Ollama và LM Studio: demo model open-weight trên laptop khi khách cấm gửi dữ liệu ra ngoài

> Khi phòng pháp chế của khách cấm mọi API cloud, buổi demo chỉ còn trông vào chiếc laptop, và kết quả phụ thuộc vào việc bạn chuẩn bị nó trước khi bước vào văn phòng khách.

Bản gốc: https://fdetimes.net/vi/cong-cu/ollama-lm-studio-chay-model-tren-laptop/

Câu "dữ liệu không được ra khỏi tòa nhà" thường kết thúc buổi demo trước khi bạn kịp mở slide. Với ngân hàng, bệnh viện hay nhà máy, đó là điều kiện bắt buộc, không còn chỗ để thương lượng. Lúc ấy, thứ FDE mang theo được chỉ là một chiếc laptop có model open-weight chạy ngay trên máy.

Ollama và LM Studio là hai cách phổ biến để làm việc đó. Chúng không cạnh tranh nhau về độ thông minh của model, vì model là của bên thứ ba. Khác biệt nằm ở cách mỗi công cụ cư xử khi máy bị cắt mạng, và chính chi tiết đó quyết định bạn có vượt qua được buổi họp với đội an ninh của khách hay không.

## Ollama hợp với người quen làm việc trên terminal

Ollama là dự án mã nguồn mở theo giấy phép MIT, chạy trên backend llama.cpp. Repo chính thức liệt kê nhiều họ model như Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma. Câu bạn nên trích cho khách nằm trong FAQ: khi chạy cục bộ, Ollama không nhìn thấy prompt hay dữ liệu của người dùng.

Điều FDE đánh giá cao nhất ở Ollama là cấu hình mặc định đã khá an toàn. Server chỉ bind vào loopback trên cổng 11434. Muốn máy khác trong mạng gọi được thì bạn phải tự đổi biến môi trường `OLLAMA_HOST`, nên việc mở ra ngoài luôn là một quyết định có chủ ý. Ứng dụng demo chạy trên cùng laptop chỉ cần gọi REST API cục bộ:

```bash
curl http://localhost:11434/api/chat -d '{
"model": "",
"messages": [{"role": "user", "content": "Tóm tắt điều khoản bảo mật này"}]
}'
```

Thử hình dung bạn demo cho một ngân hàng muốn tóm tắt hợp đồng. Trước buổi gặp, bạn tải model ở nhà. Sau đó bạn đặt `OLLAMA_MODELS` trỏ sang thư mục trên ổ mã hoá đã được bộ phận IT của khách duyệt, vì FAQ cho phép đổi nơi lưu model bằng biến này.

Bạn cũng tắt cloud features của Ollama theo hướng dẫn trong FAQ, chấp nhận mất cloud model và web search. Trong một engagement cấm egress, đánh đổi đó là đúng.

## LM Studio hợp với buổi demo cho người không viết code

LM Studio có giao diện đồ hoạ, dễ đưa cho chuyên viên nghiệp vụ tự gõ thử. Tài liệu chính thức nói những gì bạn nhập khi chat với model cục bộ không rời thiết bị. Tài liệu người dùng tải lên để hỏi đáp cũng được xử lý hoàn toàn trên máy.

Chính sách quyền riêng tư có hiệu lực từ tháng 6/2026 xác nhận thêm: khi dùng cục bộ, tin nhắn, lịch sử chat và tài liệu không bao giờ được truyền ra khỏi hệ thống, chỉ Cloud Services của hãng mới xử lý nội dung.

Runtime của LM Studio dựa trên MLX và llama.cpp, nên trên MacBook dùng Apple Silicon nó có thể chạy qua MLX. Khi cần nối ứng dụng, bạn bật server cục bộ tương thích OpenAI từ tab Developer hoặc bằng lệnh `lms server start`. Server này chạy được trên `localhost` hoặc mở ra mạng. Trong môi trường khắt khe, hãy giữ ở localhost.

**Điểm mấu chốt:** Lời hứa "dữ liệu không rời máy" chỉ đúng với phần chat, chưa chắc đúng với cả công cụ.

## Hai công cụ vẫn có những chỗ cần mạng

Đây là phần nhiều người bỏ qua. LM Studio vẫn gửi request ra ngoài, chẳng hạn tới huggingface.co, khi bạn tìm model trong tab Discover. Không có internet thì updater trong app cũng không chạy.

Model vì thế phải tải sẵn hoặc sideload, còn việc cập nhật phải làm qua kênh riêng, không làm trên chiếc laptop đã bị khoá. Danh sách model cần dùng phải được chốt và tải xong từ hôm trước, đừng mở Discover ngay tại chỗ khách chỉ để tìm thêm một model "cho chắc".

Ollama có cloud model và web search, và cả hai đều tắt được. Hãy ghi bước tắt vào script dựng máy để lần sau không phải nhớ. Nếu đội an ninh của khách soi lưu lượng mạng, một request lạ xuất hiện giữa buổi demo sẽ làm mất niềm tin nhanh hơn bất kỳ câu trả lời sai nào của model.

## Một buổi chạy thử bắt lỗi trước khi khách bắt

Lỗi dễ mắc nhất là để server mở ra mạng. LM Studio có sẵn tùy chọn này, và một lần bật để thử ở văn phòng rất dễ bị quên khi mang máy sang chỗ khách. Với Ollama, rủi ro tương tự đến từ việc đổi `OLLAMA_HOST` rồi không đổi lại.

Bước đầu của buổi chạy thử: ngắt Wi-Fi, chạy lại toàn bộ kịch bản demo từ đầu đến cuối, kể cả phần chat với tài liệu. Bước nào hỏng là bước bạn vẫn đang ngầm dựa vào mạng.

Tiếp theo, kiểm tra server đang nghe ở đâu. Trên Mac, lệnh dưới đây phải trả về địa chỉ loopback như `127.0.0.1:11434`. Nếu thấy `*:11434` hoặc IP của card mạng, server đang mở ra ngoài; làm tương tự với cổng server LM Studio đang dùng.

```bash
lsof -nP -iTCP:11434 -sTCP:LISTEN
```

Cuối cùng, bật mạng, chạy lại kịch bản và liệt kê các kết nối đang mở bằng `lsof -nP -iTCP -sTCP:ESTABLISHED`. Mọi kết nối không trỏ về 127.0.0.1 là câu hỏi bạn phải trả lời được trước khi đội an ninh của khách hỏi.

## Nên học gì trước, và ghi gì vào CV

Học Ollama trước. API của nó đơn giản, cấu hình bằng biến môi trường nên dễ ghi thành script dựng máy, và mặc định loopback giúp bạn giải thích với đội an ninh một cách rõ ràng. LM Studio nên có sẵn khi người dùng thử là người làm nghiệp vụ, hoặc khi bạn muốn tận dụng MLX trên Mac.

Khi đọc JD FDE, hãy để ý các cụm như "on-prem", "air-gapped" hay "regulated industries". Đó là dấu hiệu bạn sẽ cần kỹ năng này. Trong CV, đừng chỉ ghi "đã dùng Ollama". Hãy mô tả việc bạn dựng một môi trường demo không egress: model tải trước, lưu trên ổ mã hoá, server chỉ nghe localhost, cloud features đã tắt, có chạy thử offline.

Đội an ninh của khách thường không hỏi model của bạn thông minh tới đâu. Họ hỏi laptop của bạn sẽ gửi gì ra ngoài, và bạn nên trả lời được câu đó ngay trên terminal.

**Thử ngay tuần này:**

- Cài Ollama, tải một model thuộc họ Qwen hoặc Gemma, ngắt Wi-Fi rồi gọi thử http://localhost:11434/api/chat bằng curl
- Đặt OLLAMA_MODELS trỏ sang một thư mục trên ổ mã hoá, tải lại model và xác nhận Ollama đọc model từ đó
- Bật server của LM Studio bằng lệnh `lms server start`, rồi trỏ một script dùng SDK OpenAI sang địa chỉ localhost đó

## Nguồn

- [GitHub - ollama/ollama](https://github.com/ollama/ollama)

- [Ollama FAQ](https://docs.ollama.com/faq)

- [Offline Operation - LM Studio Docs](https://lmstudio.ai/docs/app/offline)

- [LM Studio Privacy Policy](https://lmstudio.ai/privacy)

- [LM Studio Developer Docs - Local LLM API Server](https://lmstudio.ai/docs/developer/core/server)

- [LM Studio Bionic - Your Agent for Work and Code](https://lmstudio.ai/)
