AI on-premise đọc tài liệu nội bộ: cần gì để chạy LLM tiếng Việt trên máy chủ riêng

Câu hỏi mà hầu hết tổ chức đang hỏi là: có cách nào để nhân viên hỏi đáp kho tài liệu nội bộ bằng ngôn ngữ tự nhiên mà tài liệu đó không bị gửi ra một dịch vụ nào bên ngoài? Câu trả lời ngắn là có. AI on-premise nghĩa là mô hình ngôn ngữ và toàn bộ đường đi của dữ liệu nằm trên máy chủ do bạn kiểm soát. Tài liệu được đọc, cắt nhỏ, mã hóa thành vector và trả lời tại chỗ. Không có gói tin nào chứa nội dung văn bản đi ra Internet.
Câu trả lời dài hơn thì phức tạp hơn, và đó là phần bài này tập trung vào. Chạy được một LLM tiếng Việt trên máy chủ riêng là phần dễ nhất. Phần khó là kho vector, lớp phân quyền, quy trình cập nhật tài liệu, và việc trả lời trung thực câu hỏi mô hình chạy nội bộ làm được gì và không làm được gì so với dịch vụ đám mây lớn.
Vì sao tổ chức e ngại đưa tài liệu nội bộ lên dịch vụ AI đám mây
Nỗi lo này không phải cảm tính. Nó có bốn nguồn gốc cụ thể.
- Điều khoản dữ liệu khó đọc và hay thay đổi. Cùng một nhà cung cấp thường có nhiều tầng dịch vụ với chính sách khác nhau: bản miễn phí, bản trả tiền cá nhân, bản doanh nghiệp, bản qua API. Cam kết không dùng dữ liệu để huấn luyện thường chỉ áp cho một số tầng. Nhân viên đăng ký tài khoản cá nhân rồi dán hợp đồng vào đó là chuyện xảy ra hằng ngày ở mọi tổ chức, và nó nằm ngoài mọi hợp đồng mà bộ phận pháp chế đã ký.
- Huấn luyện lại và lưu trữ phụ trợ. Ngay cả khi nhà cung cấp không huấn luyện trên dữ liệu của bạn, nội dung vẫn có thể được lưu tạm để giám sát lạm dụng, để gỡ lỗi, hoặc để phục vụ yêu cầu pháp lý ở nước sở tại. Thời gian lưu và phạm vi truy cập của đội ngũ vận hành bên đó là thứ bạn không kiểm chứng được.
- Nghĩa vụ theo pháp luật bảo vệ dữ liệu cá nhân. Nếu tài liệu nội bộ có chứa dữ liệu cá nhân, việc đưa lên một dịch vụ đặt ở nước ngoài là hành vi chuyển dữ liệu ra nước ngoài, kèm theo hồ sơ đánh giá tác động tương ứng theo Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 và Nghị định 356/2025/NĐ-CP. Đây là nghĩa vụ giấy tờ thật, không phải rủi ro giả định. Chúng tôi đã bàn kỹ hơn ở bài on-premise hay cloud dưới góc nhìn tuân thủ.
- Dữ liệu ngành nhạy cảm. Hồ sơ bệnh án, hồ sơ tín dụng, bản vẽ thiết kế, hồ sơ thầu chưa mở, tài liệu có độ mật theo quy định của ngành. Với nhóm này, câu hỏi không phải là nhà cung cấp có đáng tin không, mà là bạn có được phép đưa ra ngoài hay không. Nhiều trường hợp câu trả lời đơn giản là không.
Thêm một lớp nữa: Luật Trí tuệ nhân tạo 134/2025 đặt ra yêu cầu minh bạch và quản trị rủi ro cho hệ thống AI. Một hệ thống chạy trên hạ tầng của chính bạn thì dễ chứng minh nguồn dữ liệu, dễ ghi nhật ký, dễ giải trình hơn hẳn một hộp đen thuê ngoài.
AI on-premise gồm những mảnh ghép nào
Nhiều người hình dung AI local là "cài một con chatbot vào máy chủ". Thực tế nó là năm thành phần ghép lại, và mô hình ngôn ngữ chỉ là một trong năm.
- Mô hình ngôn ngữ. Bộ phận sinh ra câu trả lời. Đây là phần được nói nhiều nhất nhưng lại ít quyết định chất lượng nhất.
- Mô hình embedding. Bộ phận biến một đoạn văn bản thành vector số. Chất lượng embedding với tiếng Việt quyết định hệ thống có tìm đúng đoạn tài liệu hay không. Nếu bước này sai, mô hình ngôn ngữ giỏi đến mấy cũng chỉ đang viết văn trên tài liệu sai.
- Kho vector. Nơi lưu các vector kèm siêu dữ liệu của từng đoạn. Kho vector phải lưu được cả thông tin nguồn: tài liệu nào, phòng ban nào, mức mật nào. Bỏ qua phần siêu dữ liệu này là nguyên nhân gốc của mọi sự cố rò rỉ chéo nói ở dưới.
- Lớp phân quyền. Bộ lọc chạy trước khi tìm kiếm, không phải sau. Chỉ những đoạn mà người hỏi có quyền đọc mới được đưa vào ngữ cảnh.
- Giao diện hỏi đáp. Chỗ người dùng gõ câu hỏi và nhận câu trả lời kèm trích dẫn nguồn. Không có trích dẫn nguồn thì không nên triển khai, vì người dùng không có cách nào kiểm chứng.
RAG là gì
RAG là viết tắt của retrieval-augmented generation, tạm dịch là sinh câu trả lời có truy hồi tài liệu. Cơ chế rất đơn giản: khi người dùng đặt câu hỏi, hệ thống không hỏi thẳng mô hình, mà trước hết đi tìm trong kho tài liệu những đoạn liên quan nhất, rồi đưa các đoạn đó kèm câu hỏi vào mô hình và yêu cầu trả lời dựa trên đúng những đoạn đã cho.
Vì sao cách này quan trọng: mô hình không cần được huấn luyện trên tài liệu của bạn. Bạn không phải fine-tune, không phải huấn luyện lại mỗi khi có văn bản mới. Thêm một quy chế mới vào kho thì chỉ cần chỉ mục lại vài trang, hệ thống trả lời được ngay. Đây cũng là lý do RAG phù hợp với tài liệu nội bộ thay đổi liên tục, trong khi fine-tune phù hợp với việc dạy mô hình một văn phong hay một định dạng đầu ra cố định.
Hệ quả về bảo mật cũng rất đáng chú ý: vì tài liệu chỉ nằm trong ngữ cảnh của một lượt hỏi chứ không nằm trong trọng số mô hình, bạn gỡ một tài liệu khỏi kho vector là nó biến mất khỏi mọi câu trả lời sau đó. Với fine-tune thì không có nút gỡ như vậy.
Mô hình ngôn ngữ tiếng Việt mã nguồn mở chạy được trên máy chủ riêng
Tính tới thời điểm bài viết, có ba hướng thực dụng.
- Mô hình tiếng Việt chuyên biệt. PhoGPT của VinAI Research là bộ mô hình sinh tiếng Việt mã nguồn mở, gồm bản nền PhoGPT-4B và bản hội thoại PhoGPT-4B-Chat, tiền huấn luyện từ đầu trên kho ngữ liệu tiếng Việt với độ dài ngữ cảnh 8192. Ưu điểm là hiểu tiếng Việt tự nhiên và nhẹ. Nhược điểm là kiến thức nền và khả năng suy luận nhiều bước hạn chế hơn các mô hình lớn.
- Mô hình đa ngữ có tiếng Việt trong tập huấn luyện. SeaLLMs của DAMO NLP Singapore hướng riêng vào các ngôn ngữ Đông Nam Á trong đó có tiếng Việt, phát hành trọng số mở. Ngoài ra các dòng mô hình mở phổ thông cỡ vài tỉ tới vài chục tỉ tham số đều xử lý tiếng Việt ở mức dùng được cho tác vụ tóm tắt và hỏi đáp tài liệu.
- Mô hình thị giác cho tài liệu. Với hồ sơ giấy tờ scan, bạn cần một mô hình đọc được ảnh chứ không chỉ văn bản. Dòng Vintern của 5CD-AI là mô hình mở nhắm vào OCR và hiểu tài liệu tiếng Việt, chạy được on-premise. Đây là mảnh ghép hay bị bỏ quên: rất nhiều kho tài liệu nội bộ thực chất là ảnh chụp, không phải văn bản có lớp chữ.
Một lưu ý về đánh giá. Đừng chọn mô hình theo bảng xếp hạng chung. Cách chọn đúng là lấy khoảng 50 câu hỏi thật mà nhân viên hay hỏi, chạy qua vài mô hình ứng viên trên chính kho tài liệu của bạn, rồi để người am hiểu nghiệp vụ chấm. Bảng xếp hạng công khai đo trên tác vụ khác với việc tra cứu quy chế nội bộ của bạn.
Cấu hình GPU chạy mô hình cần bao nhiêu là đủ
Đây là chỗ cần nói thẳng, vì kỳ vọng sai ở bước này làm hỏng cả dự án.
Phép tính cơ bản: bộ nhớ GPU cần cho trọng số mô hình xấp xỉ bằng số tham số nhân với số byte cho mỗi tham số. Ở độ chính xác 16 bit là 2 byte, lượng tử hóa 8 bit là 1 byte, 4 bit là nửa byte. Ngoài trọng số còn cần chỗ cho bộ nhớ đệm ngữ cảnh, phần này tăng theo độ dài văn bản đưa vào và số người dùng đồng thời. Từ đó suy ra ba nhóm quy mô.
- Thử nghiệm một phòng ban. Một máy chủ với một GPU cỡ vừa đủ chạy mô hình vài tỉ tham số ở dạng lượng tử hóa, phục vụ vài người dùng đồng thời. Đủ để trả lời câu hỏi hệ thống có giá trị thật hay không, trước khi bỏ tiền lớn.
- Toàn tổ chức, tải ổn định. Một máy chủ GPU chuyên dụng bộ nhớ lớn, chạy mô hình cỡ trung ở độ chính xác cao hơn, phục vụ hàng chục người dùng đồng thời. Đây là điểm cân bằng của phần lớn doanh nghiệp Việt Nam.
- Nhiều nghìn người dùng hoặc mô hình lớn. Cụm nhiều GPU, cần thiết kế riêng về mạng, tản nhiệt và điện. Chi phí nhảy bậc rõ rệt ở ngưỡng này. Hạ tầng AI chủ quyền trong nước đã có lựa chọn cho nhóm này, nhưng nó không phải điểm khởi đầu hợp lý cho ai cả.
Giới hạn cần nói rõ với ban lãnh đạo: một mô hình mở chạy trên một máy chủ trong phòng máy của bạn sẽ không mạnh bằng mô hình lớn nhất của các nhà cung cấp đám mây. Nó không cần mạnh bằng. Với tác vụ tìm và tóm tắt một đoạn quy chế đã được truy hồi sẵn, khoảng cách năng lực thu hẹp rất nhiều so với tác vụ suy luận mở. Bán kỳ vọng đúng ngay từ đầu quan trọng hơn bán một con số ấn tượng.
Phân quyền là chỗ dễ rò rỉ dữ liệu chéo nhất
Sự cố hay gặp nhất của AI nội bộ không phải hacker bên ngoài. Đó là một nhân viên hỏi một câu bình thường và nhận được nội dung của phòng ban khác.
Cơ chế gây lỗi rất dễ hình dung. Đội triển khai nạp toàn bộ thư mục chia sẻ vào kho vector cho nhanh, rồi định lọc quyền ở bước sau. Nhưng câu trả lời đã được sinh ra từ ngữ cảnh chứa đoạn văn bản đó rồi. Lọc ở đầu ra là lọc muộn. Có ba nguyên tắc bắt buộc.
- Lọc trước khi truy hồi. Truy vấn vào kho vector phải luôn kèm điều kiện quyền của người hỏi. Không đoạn nào ngoài phạm vi quyền được lọt vào ngữ cảnh, dù chỉ một câu.
- Kế thừa quyền từ hệ thống gốc. Quyền đọc tài liệu phải lấy từ hệ thống quản lý tài liệu, không dựng một bảng phân quyền song song. Bảng song song sẽ lệch sau vài tháng, và lúc đó không ai biết bản nào đúng.
- Ghi nhật ký câu hỏi và nguồn đã dùng. Mỗi câu trả lời phải lưu lại đã lấy từ tài liệu nào. Khi có nghi vấn lộ thông tin, đây là thứ duy nhất giúp bạn dựng lại sự việc.
Một chi tiết dễ bỏ sót: khi nhân viên chuyển bộ phận hoặc nghỉ việc, quyền phải thay đổi ngay trên kho vector chứ không chỉ trên thư mục gốc. Hai nơi lệch nhau là có lỗ.
Trong Tetra eOffice, trợ lý tra cứu dùng đúng bộ quyền của văn bản trong hệ thống, nên người dùng chỉ hỏi được trên phần tài liệu họ vốn đã được xem. Xem thêm ở trang Tetra eOffice.
Khi nào bạn không cần AI local
Không phải bài toán nào cũng đáng dựng cả một hệ thống.
- Kho tài liệu nhỏ. Vài trăm văn bản và một công cụ tìm kiếm toàn văn tốt sẽ giải quyết được phần lớn nhu cầu, nhanh hơn và rẻ hơn nhiều.
- Dữ liệu vốn đã công khai. Nếu tài liệu là văn bản pháp luật, tài liệu marketing hay thông tin đã đăng trên cổng thông tin, việc dựng hạ tầng riêng để bảo vệ chúng là chi phí không tạo ra giá trị.
- Bài toán thực chất là trích xuất theo mẫu. Nếu nhu cầu là bóc dữ liệu từ hàng nghìn biểu mẫu cùng định dạng, đó không phải bài toán hỏi đáp. Một hệ thống số hóa và rút trích theo mẫu như Molly đúng việc hơn và cho kết quả ổn định hơn nhiều so với việc hỏi một mô hình hội thoại. Chúng tôi đã viết riêng về hướng này ở bài số hóa giấy tờ cũ bằng AI on-premise.
- Chưa có người vận hành. Nếu tổ chức chưa có ai đủ khả năng theo dõi GPU, cập nhật mô hình và xử lý khi hệ thống trả lời sai, hãy giải quyết vấn đề nhân sự trước.
Lộ trình thử nghiệm rồi mở rộng
Cách triển khai ít rủi ro nhất là đi từng bước, mỗi bước có tiêu chí dừng rõ ràng.
- Chọn một phòng ban và một loại tài liệu. Nhân sự với bộ quy chế nội bộ, hoặc pháp chế với kho hợp đồng mẫu. Phạm vi hẹp cho phép đánh giá thật.
- Dựng bộ câu hỏi chuẩn trước khi dựng hệ thống. Khoảng 50 câu hỏi thật kèm câu trả lời đúng do người am hiểu nghiệp vụ soạn. Đây là thước đo duy nhất đáng tin.
- Chạy thử trên phần cứng nhỏ nhất chấp nhận được. Mục tiêu của giai đoạn này là kiểm chứng giá trị, không phải kiểm chứng hiệu năng.
- Đo bằng tỉ lệ trả lời đúng có trích dẫn nguồn. Câu trả lời nghe hay nhưng không chỉ được nguồn thì tính là sai.
- Rà soát phân quyền bằng cách thử vượt quyền. Cho một tài khoản quyền thấp hỏi các câu nhắm vào tài liệu mật. Không có kết quả nào lọt ra thì mới được mở rộng.
- Mở rộng theo số phòng ban, không theo số tài liệu. Mỗi phòng ban mới đều mang theo quy tắc quyền riêng cần kiểm tra lại.
Mỗi bước nên có mốc thời gian tính bằng tuần, không phải bằng quý. Nếu sau sáu tới tám tuần thử nghiệm mà người dùng của phòng ban đầu tiên không tự quay lại dùng, vấn đề nằm ở bài toán chứ không nằm ở mô hình, và mở rộng quy mô sẽ không cứu được.
Kết
AI on-premise không phải là phiên bản kém hơn của AI đám mây. Nó là lựa chọn khác về nơi dữ liệu được xử lý, và với tài liệu nội bộ có dữ liệu cá nhân hoặc thông tin nhạy cảm theo ngành, đó thường là lựa chọn duy nhất hợp lệ. Việc chọn mô hình là phần dễ. Phần quyết định thành bại nằm ở chất lượng truy hồi, ở lớp phân quyền, và ở sự trung thực khi đặt kỳ vọng.
Nếu tổ chức của bạn đang cân nhắc hướng này và muốn bàn cụ thể về kho tài liệu, phân quyền và cấu hình phù hợp, hãy đặt lịch tư vấn với đội ngũ Tetra.
Bài viết liên quan

OKF của Google: đóng gói tri thức cho AI agent — và kinh nghiệm triển khai thực tế
Google vừa công bố OKF — chuẩn mở biến tri thức tổ chức thành thư mục Markdown cho AI agent đọc trực tiếp. Chúng tôi tải bộ mẫu về, mổ xẻ, và rút ra kinh nghiệm triển khai cho vài lĩnh vực.
Đọc ↗
WebMCP: chúng tôi vừa biến tetra.vn thành website AI agent gọi được
tetra.vn giờ expose tool cho AI agent qua chuẩn WebMCP: agent (Claude Code, Cursor…) gọi được website để hỏi sản phẩm, tri thức, điều hướng — thay vì đọc mò HTML. Đây là bước tiến AEO và cách website agent-ready khác website thường.
Đọc ↗
Angler: cổng search, crawl & nghiên cứu web mã nguồn mở, tự host
Angler là cổng search + crawl + nghiên cứu mã nguồn mở (MIT), tự host: cổng web cho AI agent (Claude Code, Cursor…) qua MCP hoặc Firecrawl SDK, biến web thành markdown sạch, chống thiên lệch cho nghiên cứu và AI agent.
Đọc ↗Checklist tuân thủ Luật Bảo vệ dữ liệu cá nhân
Rà soát doanh nghiệp trước khi Luật có hiệu lực 01/01/2026.