AI Automation

Hệ Thống Trợ Lý AI Cho Doanh Nghiệp Với BizMaC

Bạn muốn xây dựng một hệ thống trợ lý AI riêng cho doanh nghiệp, có thể xử lý dữ liệu nội bộ, trả lời khách hàng tự động mà vẫn giữ toàn quyền kiểm soát dữ liệu? Với BizMaC, bạn hoàn toàn có thể self-host một chatbot AI mạnh mẽ trên VPS, tiết kiệm chi phí, bảo mật dữ liệu và tuỳ chỉnh linh hoạt. Bài viết này sẽ hướng dẫn bạn từng bước, từ chọn phần cứng, cài đặt mô hình đến triển khai thực tế.

Tóm tắt nhanh

  • Hệ thống trợ lý AI có thể chạy hoàn toàn trên VPS với Ollama, LocalAI hoặc vLLM.
  • VPS 8GB RAM trở lên đủ cho mô hình 7B tham số dùng cho doanh nghiệp vừa và nhỏ.
  • Có thể tích hợp với Telegram, Slack, hoặc xây API riêng để nối với CRM, website.
  • Chi phí hàng tháng thấp hơn 5-10 lần so với thuê API cloud khi dùng thường xuyên.

Yêu cầu trước khi bắt đầu

  • VPS chạy Ubuntu 24.04 LTS, RAM ≥8GB, hàng đầu 16GB (khuyến nghị: thuê VPS Linux NVMe của BizMaC).
  • Dung lượng ổ cứng ≥50GB (mô hình quantized 4-bit ~4-6GB mỗi model).
  • Domain trỏ về VPS nếu muốn public API qua HTTPS.
  • Kiến thức cơ bản về Linux, Docker, và terminal.

Tại sao doanh nghiệp nên self-host trợ lý AI?

Khi bạn gửi dữ liệu nhạy cảm (hồ sơ khách hàng, chiến lược kinh doanh, tài liệu nội bộ) lên các API AI công cộng, dữ liệu đó sẽ qua server nước ngoài và có thể bị lưu trữ, huấn luyện lại. Self-host trên VPS Việt Nam cho phép bạn kiểm soát hoàn toàn: dữ liệu không rời khỏi máy chủ, không phải lo GDPR hay luật bảo mật của nước thứ ba. Thêm vào đó, với tần suất gọi API cao (hàng trăm nghìn request/tháng), self-host tiết kiệm hơn rất nhiều, trả một lần cho VPS, không tính phí theo token.

Bước 1, Chọn mô hình và công cụ phù hợp

Không phải mô hình AI nào cũng chạy được trên VPS. Dưới đây là các lựa chọn thực tế:

Mô hìnhKích thước (RAM cần)Use-case
Llama 3.1 8B (4-bit)~6-8GBChat doanh nghiệp, QA từ tài liệu
Mistral 7B (4-bit)~5-7GBHỗ trợ khách hàng, summarization
Phi-3 Mini 3.8B~3-5GBXử lý nhanh, tác vụ đơn giản

Công cụ dùng: Ollama (dễ nhất, dùng được `docker compose`), hoặc LocalAI cho tính năng advanced. Với chạy sản xuất, mình khuyên dùng Ollama vì systemd service ổn định, ít lỗi vặt.

Bước 2, Cài đặt Ollama trên VPS

Đăng nhập VPS qua SSH, chạy lệnh cài đặt nhanh (cũng có sẵn Docker image nếu bạn thích container):

curl -fsSL https://ollama.com/install.sh | sh

Sau khi cài, kiểm tra service đã chạy chưa:

systemctl status ollama

Output mong đợi: active (running). Ollama mặc định listen trên 127.0.0.1:11434, an toàn, không public ra ngoài. Bây giờ tải mô hình đầu tiên:

ollama pull llama3.1:8b
ollama pull phi3:mini

Lần đầu tải sẽ tốn thời gian (mô hình ~4-5GB). Sau khi tải xong, test thử:

ollama run llama3.1:8b "Xin chào, bạn là trợ lý AI cho doanh nghiệp. Hãy giới thiệu ngắn về dịch vụ của bạn."

Nếu nhận được câu trả lời có ý nghĩa, bạn đã cài xong phần AI core.

Bước 3, Mở API server để tích hợp

Ollama có sẵn REST API, nhưng chỉ chạy local. Để các ứng dụng khác (website, Telegram bot, Slack) gọi được, bạn cần expose API qua Nginx reverse proxy kèm HTTPS. Cài Nginx và Certbot:

apt install nginx certbot python3-certbot-nginx
systemctl enable --now nginx

Tạo file cấu hình Nginx cho subdomain AI của bạn:

sudo nano /etc/nginx/sites-available/ai.yourcompany.com

Nội dung:

server {
    listen 80;
    server_name ai.yourcompany.com;

    location / {
        proxy_pass http://127.0.0.1:11434;
        proxy_set_header Host $host;
        proxy_set_header X-Real-IP $remote_addr;
        proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for;
    }
}

Kích hoạt site và cài HTTPS:

ln -s /etc/nginx/sites-available/ai.yourcompany.com /etc/nginx/sites-enabled/
nginx -t && systemctl reload nginx
certbot --nginx -d ai.yourcompany.com

Bây giờ API có thể gọi từ bên ngoài qua HTTPS. Test bằng curl:

curl -X POST https://ai.yourcompany.com/api/generate -d '{
  "model": "llama3.1:8b",
  "prompt": "Viết một email chào mừng khách hàng mới.",
  "stream": false
}'

Bước 4, Xây dựng ứng dụng front-end cho trợ lý AI

Có vài cách để người dùng tương tác với AI của bạn:

  • Open WebUI (giao diện web giống ChatGPT): chạy bằng Docker. Cài nhanh:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Sau đó truy cập http://VPS_IP:3000 hoặc reverse proxy qua subdomain. Open WebUI tự động kết nối tới Ollama trên cùng máy, bạn chỉ cần chọn model và chat.

  • Telegram bot: viết script Python đơn giản gọi Ollama API. Dùng thư viện python-telegram-botrequests.
  • API doanh nghiệp tùy chỉnh: viết FastAPI hoặc Node.js server gọi Ollama, thêm logic xử lý prompt riêng, nối với database nội bộ.

Bước 5, Tối ưu hiệu năng cho VPS

Khi chạy sản xuất, vài cài đặt giúp VPS chịu tải tốt hơn:

  • Giới hạn số kết nối đồng thời: Ollama mặc định xử lý tuần tự, nhưng với workload nhiều user, bạn có thể set OLLAMA_NUM_PARALLEL=4 trong file /etc/systemd/system/ollama.service (dưới [Service]).
  • Dùng swap: nếu RAM 8GB, thêm swap 8GB để tránh OOM khi model tải lên:
fallocate -l 8G /swapfile
chmod 600 /swapfile
mkswap /swapfile
swapon /swapfile
echo '/swapfile none swap sw 0 0' >> /etc/fstab
  • Tắt logging không cần: trong file cấu hình Ollama, set OLLAMA_DEBUG=false (mặc định đã tắt, nhưng kiểm tra lại).
  • Monitor: dùng htopnvidia-smi (nếu có GPU) hoặc ollama ps để xem model nào đang chạy.

Xử lý lỗi thường gặp

Lỗi: "Ollama: out of memory" khi tải model

Nguyên nhân: RAM thực tế không đủ cho mô hình. Giải pháp: chọn model nhỏ hơn (như Phi-3 Mini) hoặc dùng quantized version (thêm :q4_K_M vào tên model khi pull). Kiểm tra RAM hiện tại bằng free -h trước khi tải.

Lỗi: API trả về 502 Bad Gateway từ Nginx

Kiểm tra Ollama có đang chạy không: systemctl status ollama. Nếu chạy rồi, kiểm tra Nginx log: journalctl -u nginx -n 20. Thường do proxy_pass sai port hoặc Ollama chưa listen trên 0.0.0.0 (sửa config Ollama nếu muốn cho phép truy cập từ container Nginx).

Lỗi: Open WebUI không kết nối được Ollama

Đảm bảo container Open WebUI dùng --add-host=host.docker.internal:host-gateway và Ollama đang chạy trên 0.0.0.0:11434 (có thể set env OLLAMA_HOST=0.0.0.0 trong service).

Câu hỏi thường gặp

Cần VPS cấu hình bao nhiêu để chạy trợ lý AI cho 10-20 nhân viên?

Với mô hình 7B-8B tham số (quantized), VPS 8GB RAM là đủ cho vài truy vấn đồng thời. Nếu có 20+ người dùng cùng lúc, nâng lên 16GB hoặc dùng GPU cloud. Tham khảo thuê VPS Linux của BizMaC với NVMe SSD, IPv4 Việt Nam.

Có thể dùng AI này để hỗ trợ khách hàng trong giờ hành chính không?

Có. Bạn tích hợp qua API vào website hoặc Telegram bot. Tuy nhiên, cần thêm logic failover: nếu VPS quá tải, chuyển người dùng qua mô hình nhỏ hơn hoặc queue hàng đợi.

Chi phí hàng tháng cho hệ thống này là bao nhiêu?

Chỉ tính phí VPS: khoảng 189.000đ/tháng cho VPS 2GB, nhưng cho AI cần tối thiểu 8GB (~xem bảng giá). Không có phí API cloud. So với dùng ChatGPT API cho 1 triệu token/tháng (~2-5 USD), bạn có thể tiết kiệm sau 3-4 tháng.

Làm sao để cập nhật mô hình mới hơn?

Chỉ cần chạy ollama pull tên_model_mới và chỉnh lại trong ứng dụng. Ollama quản lý nhiều model cùng lúc, bạn có thể chuyển đổi linh hoạt.

Có cần GPU không?

Không bắt buộc. Mô hình 7B chạy mượt trên CPU với 8GB RAM (khoảng 5-10 token/giây). Nếu cần tốc độ cao hơn, BizMaC cung cấp VPS có GPU để nâng cấp.

Bài viết liên quan

Lưu ý: Bài viết mang tính tham khảo, tổng hợp kiến thức chung. Mỗi hệ thống, hạ tầng và nhu cầu có đặc thù riêng, nên kiểm thử trong môi trường an toàn và tham vấn kỹ sư trước khi triển khai thực tế.