PDF Công Cụ

PDF scan sang Excel

Trích bảng từ PDF scan / PDF ảnh (không có lớp text) sang Excel bằng OCR. Hỗ trợ tiếng Việt có dấu.

Dùng OCR — phù hợp PDF chụp/scan, hoá đơn, bảng số liệu dạng ảnh
[Quảng cáo]
1

Chọn PDF scan

PDF ảnh chứa bảng

2

Nhận dạng OCR

Đọc cấu trúc + chữ

3

Tải Excel

Mỗi bảng 1 sheet

Trích bảng từ PDF scan, PDF ảnh, hoá đơn chụp sang Excel bằng OCR. Tự nhận dạng cấu trúc bảng và đọc chữ tiếng Việt có dấu, mỗi bảng xuất ra một sheet riêng.

PDF scan sang Excel giải quyết bài toán mà công cụ PDF sang Excel thường (dựa trên LibreOffice) không làm được: file PDF của bạn là ảnh chụp/scan, không có lớp text bên dưới — copy không được, LibreOffice trả về trang trống. Công cụ này dùng OCR để vừa đọc chữ vừa nhận dạng cấu trúc bảng, rồi dựng lại thành file Excel.

Engine gồm hai phần: img2table phát hiện đường kẻ và bố cục bảng (dựa trên OpenCV), EasyOCR đọc nội dung từng ô bằng mô hình tiếng Việt + tiếng Anh. Nhờ chỉ OCR trên các ô bảng đã phát hiện, kết quả gọn và nhanh hơn OCR cả trang. Mỗi bảng tìm thấy được đặt vào một sheet riêng trong file .xlsx.

Phù hợp cho hoá đơn chụp bằng điện thoại, bảng lương scan, báo cáo cũ chỉ còn bản in, bảng số liệu trong ảnh — những thứ trước đây phải gõ tay lại vào Excel.

Tính năng nổi bật

Đọc được PDF scan / PDF ảnh

Hoạt động với PDF không có lớp text (ảnh chụp, scan) — đúng loại file mà tool PDF→Excel thường bó tay.

Nhận dạng cấu trúc bảng tự động

Tự dò hàng, cột, ô của bảng có kẻ viền. Có tuỳ chọn cho bảng không kẻ viền (borderless).

OCR tiếng Việt có dấu

Mô hình EasyOCR vi + en đọc được chữ tiếng Việt có dấu, không bị mất dấu như nhiều tool OCR khác.

Mỗi bảng một sheet

Phát hiện nhiều bảng trên nhiều trang, mỗi bảng xuất thành một sheet riêng đặt tên theo trang để dễ tra cứu.

Miễn phí, không watermark

Không đăng ký. Xử lý tối đa 10 trang đầu mỗi file để giữ tốc độ hợp lý.

Cách sử dụng

  1. 1
    Bước 1: Tải PDF scan lên

    Chọn file PDF ảnh/scan chứa bảng (tối đa 30MB, xử lý 10 trang đầu).

  2. 2
    Bước 2: Chọn kiểu bảng (nếu cần)

    Để mặc định cho bảng có kẻ viền. Tích 'bảng không kẻ viền' nếu bảng của bạn không có khung kẻ.

  3. 3
    Bước 3: Trích xuất

    Nhấn 'Trích bảng sang Excel'. OCR chạy trên máy chủ, thường mất 30–90 giây tuỳ số trang.

  4. 4
    Bước 4: Tải Excel & kiểm tra lại

    Tải file .xlsx về và rà soát số liệu — OCR có thể sai ở chữ mờ, ô gộp hoặc số sát nhau.

Khi nào cần dùng

  • Hoá đơn / phiếu thu chụp bằng điện thoại — chuyển bảng mặt hàng, số lượng, thành tiền sang Excel để cộng sổ.
  • Bảng lương, bảng chấm công bản scan — số hoá lại thành Excel thay vì gõ tay.
  • Báo cáo cũ chỉ còn bản in — scan rồi trích bảng số liệu để tái sử dụng, phân tích.
  • Sao kê ngân hàng dạng ảnh — lấy bảng giao dịch ra Excel để lọc, tính tổng.
  • Bảng biểu trong slide/ảnh chụp màn hình — trích nhanh thay vì nhập lại từng ô.

Câu hỏi thường gặp

Khác gì với công cụ PDF sang Excel thường?

PDF sang Excel dùng LibreOffice, chỉ hoạt động khi PDF có lớp text (chọn/copy được chữ). Công cụ này dùng OCR nên xử lý được PDF scan/ảnh không có lớp text. Nếu file của bạn copy được chữ thì nên dùng PDF→Excel thường (chính xác hơn); nếu là ảnh chụp/scan thì dùng công cụ OCR này.

Độ chính xác có cao không?

Tốt với bảng rõ nét, có kẻ viền, chụp thẳng. Sẽ giảm với ảnh mờ, nghiêng, độ phân giải thấp, ô gộp (merged cell) hoặc chữ viết tay. OCR không bao giờ chính xác 100% — luôn nên đối chiếu lại số liệu quan trọng với bản gốc sau khi trích.

File có được upload lên server không?

Có — khác với các tool client-side, công cụ này chạy OCR trên máy chủ nên file PDF được gửi lên server để xử lý, sau đó xoá ngay sau khi trả kết quả. Không lưu trữ lâu dài. Nếu tài liệu cực kỳ nhạy cảm, cân nhắc che thông tin trước bằng Sửa PDF.

Bảng không có đường kẻ viền có nhận được không?

Có, hãy bật tuỳ chọn 'Bảng không có đường kẻ viền'. Khi đó công cụ suy luận cột/hàng theo vị trí chữ. Độ chính xác thường thấp hơn bảng có kẻ viền rõ ràng, nên nếu được hãy dùng bản scan có khung kẻ.

Xử lý được bao nhiêu trang, file bao lớn?

Tối đa 30MB và 10 trang đầu mỗi lần, để giữ thời gian xử lý hợp lý (OCR khá tốn tài nguyên). Nếu file dài hơn, hãy tách bớt bằng Tách PDF rồi trích từng phần.

Tại sao có ô bị trống hoặc sai chữ?

Do OCR không đọc được rõ ô đó (chữ quá nhỏ, mờ, dính nhau, hoặc nền nhiễu). Mẹo cải thiện: scan/chụp ở độ phân giải cao hơn, đảm bảo ảnh thẳng và đủ sáng, tương phản rõ giữa chữ và nền.

Kết quả mở được trong Excel, Google Sheets không?

Có. File xuất ra là .xlsx chuẩn, mở được trong Microsoft Excel, Google Sheets, LibreOffice Calc, WPS. Mỗi bảng nằm trên một sheet riêng, đặt tên theo số trang để dễ tìm.

Công cụ PDF khác

Khám phá thêm

Tải phần mềm miễn phí & đọc tin công nghệ

Xem danh sách 20+ phần mềm desktop miễn phí và các bài so sánh tool tại Phần Mềm Tổng Hợp.