Lưu ý quan trọng: Kỹ năng AI hỗ trợ nhận diện và tái cấu trúc văn bản scan nhưng không thay thế hoàn toàn việc kiểm tra đối chiếu các số liệu nhạy cảm hoặc chữ ký pháp lý quan trọng từ văn bản gốc.

TỔNG QUAN

Kỹ năng Bóc tách PDF Scan giải quyết bài toán số hóa tài liệu từ dạng hình ảnh chụp hoặc scan sang văn bản có cấu trúc hoàn chỉnh (DOCX, Markdown). Kỹ năng này không chỉ trích xuất text thuần túy mà còn giữ nguyên bố cục lùi dòng, khoảng cách đoạn, bảng biểu phức tạp và ảnh minh họa gốc theo chuẩn thẩm mỹ hiện đại hoặc chuẩn văn bản hành chính.

VÌ SAO KỸ NĂNG NÀY RA ĐỜI

Khi đối mặt với các tệp tài liệu scan dài hàng chục trang, các công cụ OCR thông thường hoặc mô hình AI trò chuyện thường gặp phải 3 điểm nghẽn lớn:

  1. Mất cấu trúc và vỡ bảng: Dữ liệu bảng bị biến thành chuỗi text lộn xộn, mất hoàn toàn cột và hàng.
  2. Ảo giác số liệu: Khi chất lượng ảnh scan bị mờ hoặc nghiêng, AI trò chuyện thường đoán mò ký tự thay vì có cơ chế tiền xử lý ảnh để kiểm chứng.
  3. Đứt gãy giữa chừng: Việc ném toàn bộ file PDF dung lượng lớn vào cửa sổ ngữ cảnh dễ gây tràn bộ nhớ hoặc lỗi ngắt kết nối mạng làm mất toàn bộ tiến trình.

Kỹ năng này sinh ra để thiết lập một đường ống xử lý kỷ luật gồm tách trang thành ảnh chất lượng cao, tiền xử lý quang học, nhận diện thị giác có checkpoint và biên dịch sang DOCX bằng công cụ biên tập chuyên dụng.

VÍ DỤ THỰC CHIẾN

Tình huống thực tế: Người dùng cần số hóa một bản báo cáo tổng kết scan dài 20 trang chứa nhiều bảng thống kê và biểu đồ minh họa bị scan lệch góc.

Kịch bản xử lý của Agent:

  1. Bước 1 (Render và Tiền xử lý): Agent gọi công cụ trích xuất từng trang PDF thành ảnh PNG ở độ phân giải 300 DPI, sau đó chạy thuật toán tự động cân chỉnh góc nghiêng và tăng cường độ tương phản.
  2. Bước 2 (Nhận diện Đa luồng có Checkpoint): Agent đọc từng trang ảnh qua mô hình thị giác, trích xuất cấu trúc văn bản và lưu ngay kết quả vào tệp tạm thời checkpoint.md để chống mất dữ liệu khi mất kết nối.
  3. Bước 3 (Bóc tách Hình ảnh): Agent tự động crop các biểu đồ minh họa và lưu vào thư mục tài sản.
  4. Bước 4 (Biên dịch Hoàn thiện): Agent sử dụng Pandoc và thư viện xử lý tài liệu để kết xuất file DOCX hoàn chỉnh với định dạng font chữ và lề chuẩn xác.

CẬP NHẬT TRONG BẢN MỚI NHẤT

  • Cơ chế Checkpoint tự động: Lưu vết tiến độ từng trang, cho phép tiếp tục xử lý ngay tại vị trí gián đoạn mà không cần chạy lại từ đầu.
  • Tiền xử lý ảnh nâng cao: Tự động xoay thẳng văn bản nghiêng và làm nét chữ mờ trước khi nhận diện.
  • Tối ưu chuẩn Nghị định 30: Tự động áp dụng quy chuẩn font Times New Roman, căn lề và khoảng cách dòng chuẩn hành chính.

HƯỚNG DẪN CÀI ĐẶT VÀ SỬ DỤNG

1. Cài đặt kỹ năng

  1. Giải nén file zip tải về và đưa thư mục boc-tach-pdf vào đường dẫn skills của hệ thống (ví dụ ~/.gemini/config/skills/).
  2. Khởi động lại phiên làm việc để hệ thống nạp kỹ năng mới.

2. Công thức câu lệnh kích hoạt

/boc-tach-pdf [Đường dẫn file PDF] [Tùy chọn định dạng đầu ra]

3. Mẫu prompt thực tế

Mẫu 1: Số hóa văn bản hành chính sang Word

“/boc-tach-pdf file C:/tai-lieu/quyet-dinh-scan.pdf. Hãy chuyển đổi file scan này sang file Word chuẩn Nghị định 30, giữ đúng khoảng cách thụt đầu dòng và căn lề.”

Mẫu 2: Bóc tách bảng biểu và giữ nguyên biểu đồ

“/boc-tach-pdf file C:/tai-lieu/bao-cao-tai-chinh.pdf. Bóc tách toàn bộ các bảng số liệu sang Word, trích xuất các hình biểu đồ minh họa và chèn đúng vị trí tương ứng.”

Mẫu 3: Chuyển đổi PDF scan sang Markdown có checkpoint

“/boc-tach-pdf file C:/tai-lieu/sach-huong-dan.pdf. Hãy số hóa toàn bộ cuốn sách sang file Markdown, bật cơ chế lưu checkpoint sau mỗi 5 trang.”