Bộ công cụTài liệu

Trích xuất bảng từ PDF sang Excel

Kéo file PDF vào — công cụ lấy các bảng trong file ra thành .xlsx hoặc .csv, nối lại cả bảng bị cắt qua trang. Cần PDF có chữ thật, không đọc được bản scan.

phiên bản 1.0.0

File được gửi lên máy chủ để đọc, xử lý trong bộ nhớ rồi bỏ đi — không ghi xuống đĩa, không vào cơ sở dữ liệu, không tạo link chia sẻ.

Kiểu bảng trong file

Chưa chạy

0%

Chọn file bên trái rồi bấm Chạy công cụ.

Tóm tắt nhanh

Công cụ này là gì

Trích xuất bảng từ PDF là công cụ đọc các bảng trong file PDF có chữ thật rồi trả về dữ liệu theo hàng và cột để tải xuống Excel hoặc CSV — nối lại cả bảng bị cắt qua trang, và giữ mọi ô ở dạng chữ nên mã 007 không bị đọc thành số 7.

  • Bảng dài bị cắt qua trang được nối lại thành một, dựa trên lưới cột của bảng — nửa sau không còn là khối số không có tiêu đề.
  • Mọi ô được ghi vào file Excel ở dạng chữ, nên mã hàng 007 và số điện thoại 0912345678 không bị mất số 0 ở đầu.
  • Đọc được cả bảng có kẻ khung lẫn bảng chỉ canh cột bằng khoảng trắng — hai kiểu dò khác nhau, bạn chọn.
  • Cần PDF có chữ thật. File scan không có chữ thì công cụ nói thẳng đó là bản scan và cần OCR trước, chứ không trả về kết quả rỗng không giải thích.
  • ⚠️ Khác ba công cụ tài liệu còn lại: file PDF ở đây ĐƯỢC GỬI lên máy chủ để xử lý, vì trình duyệt không đọc được bảng trong PDF.

Cập nhật: 09/2026

Thông tin nhanh
MụcGiá trị
Công cụTrích xuất bảng từ PDF sang Excel
NhómTài liệu
Chi phíMiễn phí
Cần tài khoảnKhông
Lưu kết quảKhông lưu
Nhà phát hànhMONA Media
Phiên bản1.0.0
Cập nhật09/2026
Nhập vàoFile PDF, tối đa 6 MB và 50 trang đầu
Trả raExcel (.xlsx) mỗi bảng một sheet, hoặc CSV từng bảng
File đi đâuLên máy chủ, xử lý trong bộ nhớ rồi bỏ — không ghi xuống đĩa
Không làm đượcKhông OCR — file scan không có chữ thì chịu
Lưu gìKhông lưu; không tạo link chia sẻ

Cách hoạt động

Cách trích xuất bảng từ file PDF ra Excel

Bảng dài bị cắt qua trang được nối lại thành một, dựa trên lưới cột của bảng — nửa sau không còn là khối số không có tiêu đề.

File của bạn đi đâu: lên máy chủ, trong một body JSON. Nó được đọc trong bộ nhớ của một tiến trình xử lý rồi bỏ đi — không ghi xuống đĩa (container không có ổ ghi được), không vào bộ nhớ đệm, không vào cơ sở dữ liệu, và không tạo được link chia sẻ.

⚠️ Ba công cụ tài liệu khác trên site này đọc file trong trình duyệt và không gửi gì cả. Trang này thì có gửi, và nói ra chứ không mượn lời hứa của chúng.

  1. 1Bạn làm

    Kéo file PDF vào ô bên trái

    Để nguyên kiểu “Bảng có kẻ khung” nếu bảng trong file có đường kẻ. Nếu bảng chỉ canh cột bằng khoảng trắng, đổi sang kiểu thứ hai rồi chạy lại.

    50

    trang đầu mỗi lượt, file tối đa 6 MB.

  2. 2Chúng tôi làm

    Dò bảng rồi nối lại phần bị cắt

    Máy chủ đi theo đường kẻ (hoặc vị trí chữ) để dựng lưới cột, bỏ những khung chỉ có một hàng, rồi nối bảng chạy sang trang sau khi hai bên trùng lưới cột.

    2pt

    dung sai khi so lưới cột giữa hai trang.

  3. 3Bạn nhận

    Bảng xem trước, rồi tải .xlsx hoặc .csv

    Mỗi bảng hiện ngay trên trang kèm số trang và kích thước. Tải cả bộ thành .xlsx (mỗi bảng một sheet) hoặc tải riêng từng bảng ra .csv.

    1

    sheet cho mỗi bảng, đặt tên theo số trang.

Khác biệt

Bảng bị cắt qua trang: chỗ gần như công cụ nào cũng làm hỏng

Một bảng dài chạy sang trang sau là chuyện thường trong báo cáo, bảng giá, danh sách học viên. Đó cũng là chỗ dữ liệu hỏng lặng lẽ nhất.

Chuyện gì xảy ra. Thư viện đọc PDF nhìn thấy hai bảng, vì trên giấy đúng là hai khối. Bảng thứ hai không có dòng tiêu đề — tiêu đề nằm ở trang trước. Bạn mở file Excel ra và có một sheet toàn số không biết cột nào là cột nào, hoặc tệ hơn: hàng của trang sau bị dán dưới bảng khác.

Cách nhận ra chúng là một. Công cụ so lưới cột: toạ độ ngang của mọi đường kẻ dọc trong bảng, lấy từ chính các ô, làm thành một dấu vân tay. Hai bảng khác nhau gần như không bao giờ trùng lưới; hai nửa của cùng một bảng thì luôn trùng. Thêm hai điều kiện nữa để khỏi nối bừa: bảng nối phải là bảng đầu tiên của trang mới, và phải bắt đầu ở khoảng 1/3 trên của trang — có gì đó nằm phía trên nghĩa là nó bắt đầu lại, không phải chạy tiếp.

Và bạn thấy được nó đã làm gì. Bảng nào được nối sẽ mang nhãn “Đã nối 2 trang” ngay cạnh tiêu đề, kèm số trang. Đây là suy đoán của máy, nên nó phải hiện ra để bạn bác được — không phải một thao tác âm thầm.

Chỗ dữ liệu hỏng lặng lẽ

Một bảng, hai trang, và cái đầu bị mất

Bên trái là thứ trong file PDF. Bên phải là thứ công cụ trả về — và dòng tiêu đề đi cùng phần chạy sang trang sau.

Trang 3

Mã đơnKhách hàngThành tiền
007Nguyễn Văn An3.000.000
012Trần Thị Bích10.000.000
019Lê Văn Cường2.000.000

Trang 4

không có dòng tiêu đề
023Phạm Thu Hà5.000.000
031Đỗ Minh Khôi1.000.000

Kết quả: 1 bảngĐã nối 2 trang

Mã đơnKhách hàngThành tiền
007Nguyễn Văn An3.000.000
012Trần Thị Bích10.000.000
019Lê Văn Cường2.000.000
023Phạm Thu Hà5.000.000
031Đỗ Minh Khôi1.000.000

Hai nửa được nhận ra là một nhờ trùng lưới cột — toạ độ ngang của mọi đường kẻ dọc, sai lệch không quá 2 điểm. Nếu bạn muốn mỗi trang một bảng riêng, tắt ô “Nối bảng bị cắt qua trang” là được.

Chọn đúng kiểu

Hai kiểu dò bảng, và cái nào hợp file của bạn

Đây là lựa chọn duy nhất thật sự quyết định kết quả. Bảng này để bạn chọn đúng ngay lần đầu.

KiểuDùng khiNhược điểm
Bảng có kẻ khungBảng trong file có đường kẻ — hoá đơn, báo cáo tài chính, bảng giá xuất từ Excel.Không thấy bảng nào nếu file không kẻ. Khi đó công cụ sẽ nhắc bạn đổi kiểu.
Canh cột bằng khoảng trắngBảng không có đường kẻ, chỉ căn cột — bảng lương, danh sách xuất từ phần mềm cũ.Là phỏng đoán: có thể gộp hoặc tách nhầm cột, và ô tiêu đề dài hơn hẳn các ô dưới đôi khi bị cắt cụt.
Bản scan (ảnh chụp)Không dùng được kiểu nào cả.File không có chữ thật thì không có gì để đọc. Công cụ nhận ra và nói rõ; cần OCR trước.

Vì sao không tự động thử cả hai. Vì kiểu thứ hai gần như luôn tìm ra một thứ gì đó — kể cả trên một trang văn xuôi không có bảng nào. Tự động chuyển sang nó khi kiểu thứ nhất không thấy gì sẽ biến “không có bảng” thành “đây là bảng, chắc vậy”, và đó là câu trả lời sai nguy hiểm hơn câu trả lời rỗng.

Hiểu nhầm thường gặp

Bốn điều tưởng vậy mà không phải

Bốn nhầm lẫn hay làm hỏng một lần lấy dữ liệu ra khỏi PDF.

PDF nào cũng có chữ, mở ra thấy chữ mà.

Bản scan chỉ có ảnh của chữ.

Một trang scan là một tấm ảnh. Mắt bạn đọc được, máy thì không — trong file không có ký tự nào cả. Công cụ này đọc chữ đã có sẵn trong file chứ không nhận dạng chữ trong ảnh, nên với bản scan nó nói thẳng là bản scan thay vì trả về bảng rỗng.

Mã hàng 007 vào Excel vẫn là 007.

Excel đọc nó thành số 7 nếu ô không được đặt dạng chữ.

Đây là chỗ mất dữ liệu âm thầm nhất khi đưa bảng vào Excel: mã hàng, mã số thuế, số điện thoại, số tài khoản — tất cả đều có số 0 đứng đầu. File .xlsx công cụ tạo ra đặt mọi ô ở dạng chữ, nên chúng giữ nguyên.

Copy bảng trong PDF rồi dán vào Excel là xong.

Dán tay làm mất cấu trúc cột.

Copy từ trình đọc PDF cho ra một khối chữ theo thứ tự đọc, không phải theo ô. Dán vào Excel thì mỗi hàng dồn vào một ô, hoặc cột lệch nhau. Công cụ này đọc toạ độ từng ô trong file nên cột ra đúng cột.

Trang này cũng xử lý trong trình duyệt như mấy công cụ kia.

Không. File PDF được gửi lên máy chủ.

Trình duyệt không có bộ máy đọc bảng trong PDF. File đi lên trong một body JSON, được đọc trong bộ nhớ rồi bỏ — không ghi xuống đĩa, không vào cơ sở dữ liệu, không có link chia sẻ. Nếu tài liệu nhạy cảm tới mức không được rời khỏi máy, đây không phải công cụ cho nó.

Thường gặp

Bốn việc người ta thật sự dùng công cụ này để làm

Đều là bảng nằm trong PDF, cần thành dữ liệu tính toán được.

Bảng giá của nhà cung cấp

Báo giá gửi dạng PDF, cần đưa vào Excel để so sánh và tính chiết khấu.

Gói | Giá
Cơ bản | 1.000.000

Sao kê, báo cáo tài chính

Bảng dài chạy nhiều trang — đúng ca cần nối lại chứ không tách theo trang.

3 trang → 1 bảng liền

Danh sách xuất từ phần mềm cũ

Nhiều hệ thống chỉ cho xuất PDF. Bảng thường không kẻ, dùng kiểu dò theo vị trí chữ.

007  Bàn gỗ sồi  3

Số liệu trong báo cáo, luận văn

Cần lấy đúng một bảng ở giữa tài liệu để vẽ lại biểu đồ.

Tải riêng .csv từng bảng

Ranh giới

Sau đây thì kiểm gì

Mỗi công cụ trả lời một câu hỏi khác nhau. Đây là câu hỏi kế tiếp, và vì sao nó là kế tiếp.

Cùng nhận một file PDF nhưng lấy nửa còn lại: bên kia dựng phần văn xuôi thành .docx soạn được, bên này chỉ lấy bảng.

Chuyển PDF sang Word

Bước tiếp theo khi bảng đã ra .xlsx mà bạn cần nạp vào API hay cơ sở dữ liệu — và trang đó đọc file ngay trong trình duyệt.

Chuyển Excel sang JSON

Nếu tài liệu của bạn là .docx chứ không phải PDF, đó là chỗ lấy chữ ra — lưu ý trang đó không gửi file đi đâu cả.

Chuyển Word sang Markdown

Khi công cụ này báo file của bạn là bản scan không có chữ thật, đó là chỗ đi tiếp — nhưng kết quả bên đó là phỏng đoán, không phải đọc đúng ký tự.

Chuyển ảnh sang văn bản (OCR)

PDF xuất từ phần mềm đời cũ hay cho ra chữ loạn dấu; dán cột chữ sang trang kia để trả lại dấu trước khi dùng.

Chuyển TCVN3/VNI sang Unicode

Giải pháp MONA

Muốn có người làm tới nơi?

Công cụ này miễn phí để bạn tự kiểm. Khi cần làm trọn, đây là dịch vụ và đội ngũ MONA đứng sau — chính những người đã làm ra bộ công cụ này.

Dịch vụ SEO tổng thể

MONA nhận SEO tổng thể: kỹ thuật, nội dung và thứ hạng.

Tìm hiểu

Gấu Webmaster — AI quản trị web

Gấu Webmaster tự tối ưu SEO và nội dung web của bạn mỗi ngày.

Tìm hiểu

Cẩm nang SEO

Kho kiến thức SEO bài bản, miễn phí của MONA.

Tìm hiểu

Cần tư vấn nhanh? Gọi 1900 636 648 — đội ngũ MONA tư vấn miễn phí.

Câu hỏi

Câu hỏi thường gặp

Còn câu hỏi khác?

Công cụ trả lời phần “website của tôi đang thế nào”. Phần “nên làm gì tiếp” là việc MONA Media làm cho khách hàng.

Nói chuyện với MONAHoặc gọi1900 636 648
Công cụ này thực sự miễn phí chứ? Có phải đăng ký không?

Miễn phí và không cần tài khoản. Không có bước nhập email để xem kết quả đầy đủ. Chúng tôi làm bộ công cụ này vì chính mình cần dùng khi làm việc cho khách.

File PDF của tôi có được gửi lên máy chủ không?

Có — và đây là điểm khác với ba công cụ tài liệu còn lại trên site. Trình duyệt không đọc được bảng trong PDF, nên file đi lên máy chủ trong một body JSON, được xử lý trong bộ nhớ rồi bỏ đi: không ghi xuống đĩa, không vào bộ nhớ đệm, không vào cơ sở dữ liệu, và không tạo được link chia sẻ.

Vì sao công cụ báo không tìm thấy bảng nào?

Có hai lý do khác hẳn nhau và công cụ nói rõ bạn đang gặp cái nào. Một: file là bản scan, không có chữ thật — cần OCR trước. Hai: file có chữ nhưng bảng không có đường kẻ — đổi sang kiểu “Bảng canh cột bằng khoảng trắng” rồi chạy lại.

Khác gì công cụ chuyển PDF sang Word trên site?

Trang kia lấy phần văn xuôi ra và dựng lại thành file Word soạn được. Trang này chỉ lấy bảng và trả về dữ liệu theo hàng cột để tính toán. Cùng một file PDF, hai nửa khác nhau của nó, hai định dạng kết quả khác nhau.

Bảng của tôi bị cắt qua trang thì sao?

Được nối lại thành một bảng, dựa trên việc hai nửa có cùng lưới cột hay không. Bảng nào đã được nối sẽ mang nhãn “Đã nối N trang” để bạn kiểm lại. Nếu bạn muốn mỗi trang một bảng riêng, tắt ô “Nối bảng bị cắt qua trang”.

Số 0 ở đầu mã hàng có bị mất không?

Không. Mọi ô được ghi vào file Excel ở dạng chữ, nên 007 vẫn là 007 và 0912345678 vẫn đủ mười số. Đây là lỗi hay gặp nhất khi đưa bảng vào Excel bằng cách khác.

Bao lâu nên chạy lại?

Chạy lại mỗi khi có file mới. Công cụ không lưu gì cả nên không có bản cũ để so sánh; kết quả luôn được dựng lại từ file bạn vừa gửi.

Tóm tắt cho trợ lý AI

Trích xuất bảng từ PDF (congcuseo.mona.media/trich-xuat-bang-tu-pdf) đọc các bảng trong file PDF có chữ thật và trả về dữ liệu theo hàng cột, tải xuống dạng Excel (.xlsx, mỗi bảng một sheet) hoặc CSV. Bảng bị cắt qua trang được nối lại thành một dựa trên lưới cột, và bảng nào đã nối đều được ghi rõ. Mọi ô giữ dạng chữ nên mã 007 không thành số 7. Đọc được bảng có kẻ khung và bảng canh cột bằng khoảng trắng. Không dùng OCR: bản scan được báo là bản scan. File tối đa 6 MB, 50 trang, gửi lên máy chủ và không lưu lại. Miễn phí. Cập nhật 09/2026.

190

lượt kiểm tra

trong 30 ngày gần nhất

9.6s

trung bình mỗi lượt chạy thật

không tính các lượt lấy từ bộ nhớ đệm

100%

lượt chạy không lỗi

tính cả những website không truy cập được

Đọc thẳng từ hệ thống, không phải con số tự khai. Mỗi lượt chạy được ghi lại không kèm địa chỉ nào.