OCR tiếng Việt: biến ảnh giấy tờ thành dữ liệu dùng được (và an toàn)

Ảnh: Dimitri Karastelev / Unsplash
Nhiều người nghĩ OCR là xong: quét ảnh, ra chữ. Nhưng cái doanh nghiệp thật sự cần không phải một trang chữ, mà là dữ liệu có cấu trúc — họ tên, ngày tháng, số tiền, số hồ sơ — để nhập thẳng vào hệ thống. Đó là khoảng cách giữa "đọc được chữ" và "dùng được dữ liệu". Bài này nói về chính công nghệ lấp khoảng cách đó: OCR tiếng Việt khó ở đâu, khác gì với trích xuất dữ liệu, đường đi từ tấm ảnh đến ô Excel, và vì sao cách làm theo mẫu trên số lượng lớn lại cho kết quả ổn định hơn hẳn việc hỏi một mô hình hội thoại.
Vì sao OCR tiếng Việt khó hơn bạn tưởng
Tiếng Việt không khó vì lạ, mà vì đặc trưng chữ viết chồng lên chất lượng ảnh thực tế.
Dấu thanh và dấu chữ. Một chữ cái tiếng Việt có thể mang cả dấu mũ lẫn dấu thanh: "ầ", "ệ", "ưở". Khi ảnh mờ, nghiêng hay in đè, mô hình rất dễ nhầm "à" thành "á", "ẻ" thành "ẽ". Sai một dấu là sai cả nghĩa, và với tên riêng thì sai một dấu là sai cả hồ sơ.
Font trộn và cỡ chữ không đều. Giấy tờ thật hiếm khi một font. Một tờ khai có thể vừa in máy, vừa dập chữ bằng máy chữ cũ, vừa đóng dấu mộc, lại thêm phần điền tay. Mỗi lớp là một kiểu nhận dạng khác nhau.
Con dấu và chữ ký đè lên chữ. Dấu đỏ tròn thường đóng trùm lên phần chữ quan trọng nhất — ngày tháng, số hiệu, chữ ký người có thẩm quyền. Mắt người vẫn đọc xuyên qua được, còn OCR thuần thì coi vệt mực đỏ là nhiễu và đọc sai phần bên dưới.
Bảng biểu và bố cục. Rất nhiều văn bản là bảng: danh sách, biểu kê, tờ khai nhiều cột. Đọc đúng chữ chưa đủ; phải hiểu chữ đó thuộc ô nào, hàng nào, để dữ liệu về đúng cột. Đây là chỗ công cụ chỉ làm nhận dạng ký tự hay vấp nhất.
Chữ viết tay. Cần nói thẳng: chữ viết tay là phần khó nhất và không có công cụ nào bảo đảm đúng tuyệt đối, nhất là chữ thảo hay ký tự viết ngoáy. Với ô điền tay quan trọng, cách làm trung thực là để máy đọc trước rồi người xác nhận, không phải hứa một con số chính xác không có thật.
OCR và trích xuất dữ liệu khác nhau thế nào
Hai việc này hay bị gộp làm một, nhưng chúng giải quyết hai bài toán khác nhau.
OCR (nhận dạng ký tự quang học) biến ảnh thành văn bản. Kết quả là một khối chữ chạy dài, đúng thứ tự đọc nhưng không có ý nghĩa cấu trúc. Máy biết đó là chữ, không biết đâu là tên nhà cung cấp, đâu là ngày, đâu là tổng tiền.
Trích xuất dữ liệu đi xa hơn: hiểu tài liệu thuộc loại gì, rồi lấy đúng các trường cần thiết thành dữ liệu có nhãn. Với một hóa đơn, OCR cho bạn cả trang chữ; còn trích xuất cho bạn ba trường rõ ràng — nhà cung cấp, ngày, tổng tiền — sẵn sàng đẩy sang Excel hay phần mềm kế toán mà không phải copy-paste thủ công.
Sự khác biệt này quyết định giá trị thực tế. Một trang chữ vẫn cần người ngồi đọc và gõ lại vào hệ thống — công đoạn chậm và dễ sai nhất vẫn nằm nguyên đó. Còn dữ liệu có cấu trúc thì nhập được thẳng, tra cứu được ngay, đối chiếu được tự động. Doanh nghiệp không trả tiền để có thêm một trang chữ; họ trả tiền để bớt một người gõ.
Đường đi từ tấm ảnh đến ô Excel
Một hệ trích xuất dữ liệu chỉnh chu đi qua mấy bước, và bước nào hỏng cũng kéo chất lượng cuối xuống.
Chuẩn hóa ảnh đầu vào. Nắn lại ảnh nghiêng, tăng tương phản, xử lý nền ố vàng hay nếp gấp. Ảnh vào càng sạch, mọi bước sau càng dễ. Đây là công đoạn ít được nhắc nhưng bù lại nhiều lỗi nhất.
Đọc chữ và hiểu bố cục cùng lúc. Ở đây có một thay đổi đáng kể so với công cụ cũ. Mô hình AI vision đọc được cả chữ in lẫn bố cục trang trong một lần, nên không cần ghép một engine OCR riêng rồi lại ghép một lớp phân tích bố cục riêng. Máy nhìn tấm ảnh như một tổng thể: đây là bảng, đây là ô ngày, đây là phần đóng dấu.
Ánh xạ vào các trường cần lấy. Chữ đã đọc được gắn vào đúng nhãn dữ liệu — trường "họ tên", trường "ngày cấp", trường "số hiệu". Đây chính là bước biến văn bản thô thành dữ liệu dùng được.
Kết xuất có cấu trúc. Kết quả ra Excel, CSV hoặc đẩy sang hệ thống khác qua API. Đến đây dữ liệu đã sẵn sàng cho việc tra cứu, thống kê, đối chiếu — không còn là hình ảnh.
Vì sao làm theo mẫu lại hợp với số lượng lớn
Điểm mấu chốt để hiểu công nghệ này: trích xuất theo mẫu và hỏi đáp tự do là hai bài toán khác nhau.
Nếu bạn có hàng nghìn giấy tờ cùng một biểu mẫu — đơn đăng ký kết hôn, tờ khai nhân sự, hóa đơn cùng định dạng — thì vị trí và ý nghĩa các trường gần như cố định. Bạn định nghĩa mẫu một lần: khai báo các trường cần lấy, đánh dấu trường nào bắt buộc, trường nào nhạy cảm. Từ đó mỗi tấm ảnh chỉ việc điền vào khuôn đã biết. Cách này cho kết quả ổn định và kiểm soát được, vì máy luôn biết nó đang tìm gì.
Ngược lại, ném cùng tập giấy tờ đó cho một trợ lý trò chuyện rồi hỏi từng câu là cách làm chậm, tốn và khó lường: mỗi lần hỏi một kiểu, mỗi lần trả lời một kiểu, không có khuôn để đối chiếu. Với văn bản cùng template số lượng lớn, cách theo mẫu đúng việc hơn nhiều. Chúng tôi đã bàn kỹ hơn ranh giới giữa hỏi đáp tài liệu và trích xuất theo mẫu ở bài AI on-premise đọc tài liệu nội bộ.
Đây cũng là lý do trích xuất theo mẫu là công cụ số hóa và rút trích, không phải trợ lý trò chuyện với tài liệu. Đặt đúng công cụ cho đúng bài toán quan trọng hơn chọn mô hình to nhất.
Kiểm chứng và độ chính xác: máy đọc, người duyệt
Không công cụ nào đọc đúng 100% trên giấy tờ thật, và bất kỳ ai hứa như vậy đều đáng ngờ. Vấn đề không phải là loại bỏ sai sót, mà là bắt được sai sót trước khi nó vào hệ thống.
Cách làm đáng tin là để máy đọc và điền sẵn, rồi một người duyệt lại bên cạnh bản gốc — nhìn tấm ảnh và ô dữ liệu cạnh nhau, sửa chỗ lệch rồi mới lưu. Với văn bản in rõ, phần lớn trường máy điền đúng và người chỉ lướt xác nhận. Với ô viết tay hay chỗ bị dấu đè, người tập trung kiểm ở đúng những chỗ khó đó. Cách này nhanh hơn gõ tay toàn bộ nhiều lần, mà vẫn giữ được một người chịu trách nhiệm cuối.
Vài nguyên tắc giúp việc kiểm chứng thực chất:
- Đánh dấu trường nghi ngờ. Chỗ máy không chắc nên được nêu bật để người duyệt để mắt trước, thay vì phải rà đều cả trang.
- Ràng buộc theo định dạng. Ngày phải ra ngày, số căn cước phải đủ chữ số. Ràng buộc đơn giản này chặn được nhiều lỗi đọc nhầm ngay tại chỗ.
- Lưu vết chỉnh sửa. Ai sửa gì, khi nào, từ giá trị máy đọc sang giá trị nào — cần cho đối soát về sau và cho những hồ sơ có yêu cầu tuân thủ.
Và một lời thẳng thắn: đừng tin con số chính xác trong quảng cáo. Con số duy nhất đáng tin là kết quả chạy thử trên chính giấy tờ của bạn, với chất lượng ảnh và loại văn bản thật của bạn.
Chạy nội bộ, vì dữ liệu là của bạn
OCR online miễn phí tiện cho vài tấm ảnh không quan trọng. Nhưng với hồ sơ chứa thông tin cá nhân — căn cước, hợp đồng, hồ sơ nhân sự, giấy tờ hộ tịch — đưa lên một dịch vụ nước ngoài là đẩy dữ liệu ra ngoài tầm kiểm soát. Theo Luật Bảo vệ dữ liệu cá nhân, việc này còn có thể bị coi là chuyển dữ liệu cá nhân ra nước ngoài, kèm nghĩa vụ hồ sơ riêng. Dữ liệu nhạy cảm nên được xử lý ngay trong mạng của bạn.
Cách an toàn là chạy toàn bộ việc đọc và trích xuất trên máy chủ của chính bạn. Mô hình AI vision chạy nội bộ đọc được cả chữ lẫn bố cục, kết quả đẩy thẳng sang Excel hoặc hệ thống khác qua API, và không một dòng nào rời khỏi hạ tầng của bạn. Hướng số hóa nội bộ này chúng tôi đã viết cho trường hợp hồ sơ giấy tồn đọng ở bài số hóa giấy tờ cũ bằng AI on-premise.
Tóm lại: chọn đúng công cụ cho đúng việc
Nếu việc của bạn là bóc dữ liệu từ số lượng lớn giấy tờ cùng mẫu, hãy dựa vào mấy điểm sau khi đánh giá công cụ:
- Đầu ra là dữ liệu có cấu trúc, không phải một trang chữ. Trường có nhãn, đẩy được sang Excel và hệ thống khác.
- Làm theo mẫu. Định nghĩa các trường một lần, áp cho cả tập — ổn định hơn hỏi đáp tự do.
- Có người duyệt và lưu vết. Máy đọc, người xác nhận bên cạnh bản gốc, mọi chỉnh sửa được ghi lại.
- Xử lý được đặc thù tiếng Việt. Dấu, font trộn, con dấu, bảng biểu; và trung thực về giới hạn của chữ viết tay.
- Chạy nội bộ với dữ liệu nhạy cảm. Không đưa hồ sơ có thông tin cá nhân lên dịch vụ ngoài.
Molly là công cụ đúng theo hướng này: số hóa giấy tờ hàng loạt và rút trích dữ liệu có cấu trúc, chạy hoàn toàn nội bộ trên hạ tầng của bạn. Bạn định nghĩa mẫu một lần, đưa cả tập ảnh vào, AI đọc và điền sẵn, một người duyệt lại bên cạnh bản gốc rồi lưu. Bản quyền miễn phí; bạn chỉ trả phí cài đặt, phần cứng tự trang bị. Đừng tin con số quảng cáo — đặt lịch demo Molly và thử với chính giấy tờ của bạn, chạy trên hạ tầng của bạn.
Bài viết liên quan

OKF của Google: đóng gói tri thức cho AI agent — và kinh nghiệm triển khai thực tế
Google vừa công bố OKF — chuẩn mở biến tri thức tổ chức thành thư mục Markdown cho AI agent đọc trực tiếp. Chúng tôi tải bộ mẫu về, mổ xẻ, và rút ra kinh nghiệm triển khai cho vài lĩnh vực.
Đọc ↗
WebMCP: chúng tôi vừa biến tetra.vn thành website AI agent gọi được
tetra.vn giờ expose tool cho AI agent qua chuẩn WebMCP: agent (Claude Code, Cursor…) gọi được website để hỏi sản phẩm, tri thức, điều hướng — thay vì đọc mò HTML. Đây là bước tiến AEO và cách website agent-ready khác website thường.
Đọc ↗
Angler: cổng search, crawl & nghiên cứu web mã nguồn mở, tự host
Angler là cổng search + crawl + nghiên cứu mã nguồn mở (MIT), tự host: cổng web cho AI agent (Claude Code, Cursor…) qua MCP hoặc Firecrawl SDK, biến web thành markdown sạch, chống thiên lệch cho nghiên cứu và AI agent.
Đọc ↗Checklist tuân thủ Luật Bảo vệ dữ liệu cá nhân
Rà soát doanh nghiệp trước khi Luật có hiệu lực 01/01/2026.