Ảnh: Towfiqu barbhuiya / Unsplash
Gần như tổ chức nào cũng đã đưa phần lớn công việc hằng ngày lên phần mềm. Nhưng ở góc phòng lưu trữ, trong những cái tủ sắt cũ, vẫn còn hàng nghìn bộ hồ sơ giấy chưa ai đụng tới — sổ hộ tịch, giấy khai sinh, đăng ký kết hôn, hồ sơ đất đai, hồ sơ của người lớn tuổi ở phường, xã. Chúng vẫn có giá trị pháp lý, vẫn được tra cứu, nhưng nằm ngoài mọi hệ thống số. Hệ quả rất cụ thể: một người dân đến xin trích lục, cán bộ phải xuống kho lục từng tập, dò từng trang; dịch vụ công vì thế mà chậm, và không ít lần người dân phải nộp lại đúng thứ giấy tờ mà cơ quan đã giữ.
Số hóa đống giấy cũ này nghe thì đơn giản, làm thì vướng hai chỗ cùng lúc: khối lượng quá lớn để nhập tay, còn nội dung thì quá nhạy cảm để tùy tiện đưa lên một dịch vụ bên ngoài. Bài viết này nói về cách gỡ cả hai nút đó bằng AI chạy ngay trên hạ tầng của bạn.
Vì sao hồ sơ giấy cũ là bài toán khó
Nhập liệu tay từ giấy vừa chậm vừa dễ sai. Một tập hồ sơ hộ tịch vài chục năm có thể lên tới hàng vạn trang; giao cho người gõ lại từng trường thì vừa tốn người, vừa mệt mỏi, và sai sót tích lũy dần theo từng ngày làm việc. Đây là loại việc lặp lại đến mức không ai muốn nhận, nhưng lại không thể bỏ.
Giấy cũ còn khó ở chất lượng bản gốc. Chữ mờ theo thời gian, mực phai, giấy ố, dấu giáp lai chồng lên chữ, có bản viết tay, có bản đánh máy chữ, khổ giấy không đều. Ảnh chụp hay bản scan thường bị nghiêng, nhăn hoặc thiếu sáng. Những chỗ này chính là nơi các công cụ đọc chữ đơn thuần hay vấp — phần khó nhất luôn là hiểu đúng bố cục của tờ giấy, chứ không chỉ đọc ra ký tự. Chúng tôi đã bàn kỹ hơn sự khác nhau giữa đọc chữ và lấy đúng dữ liệu ở bài OCR tiếng Việt: biến ảnh giấy tờ thành dữ liệu dùng được.
Nhưng rào cản lớn nhất không phải kỹ thuật, mà là dữ liệu cá nhân. Hồ sơ hộ tịch chứa toàn thông tin thuộc diện được bảo vệ: họ tên, ngày sinh, quê quán, quan hệ nhân thân. Muốn dùng OCR hay AI cho nhanh, người phụ trách lập tức vướng câu hỏi: đưa những tờ giấy này lên một dịch vụ đám mây đặt ở nước ngoài thì có được phép không, và ai chịu trách nhiệm nếu rò rỉ? Với hồ sơ công dân, câu trả lời thận trọng thường là không.
Vì sao nên xử lý bằng AI chạy nội bộ
Cách gỡ nút thắt là để việc đọc và trích xuất diễn ra ngay trên máy chủ của tổ chức, thay vì gửi ảnh ra ngoài. Một mô hình AI thị giác chạy nội bộ — ví dụ dòng Gemma mã nguồn mở của Google — đọc được cả chữ in, chữ đánh máy lẫn bố cục tờ giấy, nên không cần ghép thêm một engine OCR riêng. Toàn bộ quá trình nằm gọn trong mạng của bạn: ảnh vào, dữ liệu ra, không một tấm nào rời khỏi hạ tầng.
Điểm mấu chốt ở đây là chủ quyền dữ liệu. Khi mô hình và toàn bộ đường đi của dữ liệu đều nằm trên phần cứng bạn kiểm soát, bạn không phải phụ thuộc vào điều khoản của một nhà cung cấp có thể đổi bất cứ lúc nào, không phải lo dữ liệu bị lưu tạm ở đâu đó để phục vụ mục đích ngoài tầm kiểm chứng. Với hồ sơ công dân, đây không chỉ là chuyện an tâm mà còn là chuyện tuân thủ: giữ dữ liệu ở trong nước, xử lý tại chỗ, tránh được nghĩa vụ và rủi ro của việc chuyển dữ liệu cá nhân ra nước ngoài. Chúng tôi đã phân tích rõ hơn cách dựng một hệ thống AI đọc tài liệu chạy hoàn toàn trong nhà ở bài AI on-premise đọc tài liệu nội bộ.
Cần nói thẳng một điều để tránh kỳ vọng lệch: đây không phải là dựng một trợ lý trò chuyện để hỏi đáp về kho giấy tờ. Bài toán số hóa hồ sơ cũ là bài toán bóc đúng vài trường dữ liệu từ hàng nghìn tờ có cùng khuôn mẫu, làm đi làm lại thật ổn định — một việc rất khác với hỏi đáp mở, và cần một công cụ làm đúng việc đó.
Đường đi của một tờ giấy: từ tủ lưu trữ thành dữ liệu tra cứu
Số hóa theo mẫu là một quy trình có các bước rõ ràng, không phải một phép màu một-nút-bấm. Hình dung một tờ theo trình tự sau.
Chụp hoặc scan. Đưa tờ giấy thành ảnh số. Bước này quyết định phần lớn chất lượng về sau: ánh sáng đều, đặt phẳng, đủ độ phân giải để đọc được cả những dòng chữ nhỏ và con dấu. Một quy ước đặt tên và sắp xếp file ngay từ đầu sẽ tiết kiệm rất nhiều công về sau.
Đọc và nhận dạng. Mô hình AI thị giác đọc nội dung tờ giấy, nhận ra đây là loại văn bản gì và các trường nằm ở đâu. Vì mô hình hiểu cả bố cục nên nó phân biệt được đâu là tiêu đề, đâu là ô ngày tháng, đâu là phần chữ ký.
Trích xuất theo mẫu. Bạn đã khai báo trước một mẫu cho từng loại hồ sơ — cần lấy những trường nào, trường nào là nhạy cảm. Mô hình điền các trường đó thành dữ liệu có cấu trúc, thay vì trả về một trang chữ thô. Chính vì các tờ trong cùng một kho dùng chung khuôn mẫu nên bước này chạy ổn định và nhất quán.
Đối chiếu và duyệt. Một người kiểm tra đặt bản gốc cạnh dữ liệu máy đọc ra, sửa chỗ sai, rồi phê duyệt. Đây là bước không được bỏ đối với hồ sơ pháp lý: con người vẫn là người chịu trách nhiệm cuối, còn AI chỉ lo phần nặng nhọc là gõ lại. Mọi chỉnh sửa và phê duyệt đều được lưu vết.
Lưu và kết nối. Dữ liệu đã duyệt vào cơ sở dữ liệu, tra cứu được tức thì và đẩy sang các hệ thống khác qua API khi cần. Từ đây, việc trích lục một hồ sơ từ chỗ lục tủ hàng giờ trở thành gõ tìm trong vài giây.
Vì sao độ chính xác cao hơn với hồ sơ cùng khuôn mẫu
Có một lý do kỹ thuật khiến việc số hóa hồ sơ hộ tịch dễ làm cho ra kết quả tốt hơn nhiều so với việc bóc dữ liệu từ tài liệu tạp nham. Khi hàng nghìn tờ đều theo cùng một mẫu — cùng vị trí ô họ tên, cùng chỗ ghi ngày, cùng bố cục — hệ thống không phải đoán lại cấu trúc cho từng tờ. Bạn khai báo mẫu một lần, và mẫu đó áp dụng cho cả kho. Sai số vì hiểu nhầm bố cục, vốn là nguồn lỗi lớn nhất của OCR tổng quát, gần như biến mất.
Điều này cũng làm cho bước con người duyệt lại nhẹ đi. Khi các trường luôn nằm đúng chỗ dự kiến, người kiểm tra chỉ cần liếc qua để bắt lỗi chứ không phải dò lại từ đầu. Với những trường quan trọng như ngày tháng hay số định danh, có thể đặt quy tắc kiểm tra định dạng để hệ thống tự gắn cờ chỗ đáng ngờ, đưa đúng những tờ cần soi kỹ lên trước mắt người duyệt.
Một lưu ý trung thực: không công cụ nào đọc đúng 100% ngay từ lần đầu, nhất là với giấy cũ mờ hay chữ viết tay. Giá trị thật không nằm ở con số quảng cáo về độ chính xác, mà ở chỗ AI gánh phần gõ lại nặng nhọc còn con người tập trung vào việc soát và quyết. Đó là lý do bước duyệt luôn nằm trong quy trình, không phải một tùy chọn.
Quản trị và bảo mật khi số hóa hồ sơ công dân
Số hóa hồ sơ cá nhân không chỉ là chuyện chạy cho xong, mà phải chạy đúng cách để chịu được kiểm tra về sau. Vài nguyên tắc nên đặt ra ngay từ đầu.
Dữ liệu không rời khỏi nhà. Vì mô hình chạy nội bộ, ảnh gốc và dữ liệu trích xuất đều nằm trong hạ tầng của bạn. Đây là nền tảng để nói chuyện tuân thủ: giữ dữ liệu trong nước, hạn chế tối đa việc đưa dữ liệu cá nhân ra ngoài.
Phân quyền theo vai trò. Không phải ai cũng được xem mọi hồ sơ. Người quét, người duyệt, người tra cứu nên có quyền khác nhau, và quyền đó nên bám theo nghiệp vụ thực tế của từng vị trí.
Lưu vết đầy đủ. Ai đã đọc, đã sửa, đã duyệt tờ nào, lúc nào — tất cả cần được ghi lại. Khi có nghi vấn về sai sót hay lộ thông tin, nhật ký này là thứ duy nhất giúp bạn dựng lại sự việc.
Đánh dấu trường nhạy cảm. Ngay trong mẫu, những trường thuộc diện dữ liệu cá nhân nên được đánh dấu để về sau dễ kiểm soát cách hiển thị, xuất và chia sẻ.
Chốt lại: một danh sách để bắt đầu
Nếu tổ chức của bạn đang có những cái tủ hồ sơ giấy chờ được số hóa, có thể khởi động theo mấy bước gọn sau. Chọn một loại hồ sơ có khối lượng lớn và cùng khuôn mẫu để làm trước, ví dụ đăng ký kết hôn hoặc khai sinh. Khai báo mẫu cho loại đó, liệt kê các trường cần lấy và đánh dấu trường nhạy cảm. Chuẩn hóa khâu chụp hoặc scan để ảnh đủ rõ. Cho AI chạy trích xuất rồi để một người duyệt lại bên cạnh bản gốc, có lưu vết. Cuối cùng, đưa dữ liệu đã duyệt vào cơ sở dữ liệu tra cứu và giữ toàn bộ quá trình trên hạ tầng của bạn.
Molly là công cụ Tetra làm đúng bài toán này: số hóa hàng loạt hồ sơ cùng khuôn mẫu và bóc thành dữ liệu tra cứu được, mô hình chạy 100% trên hạ tầng của bạn, dữ liệu công dân không ra ngoài. Molly là công cụ số hóa và trích lục, không phải trợ lý hội thoại. Cách chắc chắn nhất để biết nó hợp với kho hồ sơ của bạn là thử trên chính giấy tờ của bạn — đặt lịch demo Molly với đội ngũ Tetra.
Bài viết liên quan

OKF của Google: đóng gói tri thức cho AI agent — và kinh nghiệm triển khai thực tế
Google vừa công bố OKF — chuẩn mở biến tri thức tổ chức thành thư mục Markdown cho AI agent đọc trực tiếp. Chúng tôi tải bộ mẫu về, mổ xẻ, và rút ra kinh nghiệm triển khai cho vài lĩnh vực.
Đọc ↗
WebMCP: chúng tôi vừa biến tetra.vn thành website AI agent gọi được
tetra.vn giờ expose tool cho AI agent qua chuẩn WebMCP: agent (Claude Code, Cursor…) gọi được website để hỏi sản phẩm, tri thức, điều hướng — thay vì đọc mò HTML. Đây là bước tiến AEO và cách website agent-ready khác website thường.
Đọc ↗
Angler: cổng search, crawl & nghiên cứu web mã nguồn mở, tự host
Angler là cổng search + crawl + nghiên cứu mã nguồn mở (MIT), tự host: cổng web cho AI agent (Claude Code, Cursor…) qua MCP hoặc Firecrawl SDK, biến web thành markdown sạch, chống thiên lệch cho nghiên cứu và AI agent.
Đọc ↗Checklist tuân thủ Luật Bảo vệ dữ liệu cá nhân
Rà soát doanh nghiệp trước khi Luật có hiệu lực 01/01/2026.
