Bộ công cụTài liệu

Chuyển ảnh sang văn bản: OCR tiếng Việt ngay trong trình duyệt

Kéo ảnh chụp trang giấy vào — công cụ đọc chữ in trong ảnh và trả về văn bản copy được. Ảnh không rời khỏi máy bạn.

phiên bản 1.0.0

Ảnh được đọc ngay trong trình duyệt và không được gửi đi đâu cả. Lần chạy đầu tiên tải khoảng 5 MB bộ nhận dạng từ chính trang này — sau đó trình duyệt giữ lại.

Cách xuống dòng

Chưa chạy

0%

Điền thông tin bên trái rồi bấm Chạy công cụ.

Tóm tắt nhanh

Công cụ này là gì

Chuyển ảnh sang văn bản là công cụ OCR nhận dạng chữ in trong ảnh — kể cả tiếng Việt có dấu — và trả về văn bản copy được, chạy hoàn toàn bằng WebAssembly trong trình duyệt nên ảnh không rời khỏi máy bạn.

  • Ảnh được nhận dạng ngay trong trình duyệt; không byte nào của ảnh đi ra mạng — mở tab Network là kiểm được.
  • Cả bộ nhận dạng (khoảng 5 MB WebAssembly và dữ liệu tiếng Việt) cũng tải từ chính trang này, không qua CDN của bên thứ ba.
  • Đây là nhận dạng, không phải chuyển đổi: kết quả là phỏng đoán, và công cụ hiện luôn độ chắc chắn cùng danh sách những chữ máy không dám chắc để bạn soát.
  • Dấu tiếng Việt là chỗ sai nhiều nhất. Chữ viết tay gần như không đọc được, và bảng biểu ra thành dòng chữ chứ không thành bảng.
  • PDF có chữ thật thì đừng OCR — dùng thẳng công cụ đọc PDF, chính xác hơn hẳn.

Cập nhật: 09/2026

Thông tin nhanh
MụcGiá trị
Công cụChuyển ảnh sang văn bản: OCR tiếng Việt ngay trong trình duyệt
NhómTài liệu
Chi phíMiễn phí
Cần tài khoảnKhông
Lưu kết quảKhông lưu
Nhà phát hànhMONA Media
Phiên bản1.0.0
Cập nhật09/2026
Nhập vàoẢnh JPG, PNG, WebP — tối đa 15 MB
Trả raVăn bản copy được hoặc tải về .txt
Ảnh đi đâuKhông đi đâu cả — nhận dạng trong trình duyệt
Tải lần đầu~5 MB bộ nhận dạng, từ chính trang này
Lưu gìKhông lưu; không tạo link chia sẻ

Cách hoạt động

Cách chuyển ảnh chụp thành văn bản có dấu

Ảnh được nhận dạng ngay trong trình duyệt; không byte nào của ảnh đi ra mạng — mở tab Network là kiểm được.

Cái gì rời khỏi máy bạn: một lượt gọi API duy nhất, mang theo dung lượng ảnh và kiểu xuống dòng bạn chọn. Không tên file, không một pixel nào.

Và cái gì đi vào: ba file tĩnh từ chính tên miền này — /tesseract/. Thư viện OCR mặc định tải chúng từ CDN của bên thứ ba; như thế thì mỗi lượt chạy đều báo cho một bên khác biết bạn đang nhận dạng ảnh, trên đúng trang hứa rằng ảnh không đi đâu cả.

  1. 1Bạn làm

    Kéo ảnh có chữ vào ô bên trái

    Ảnh hiện ngay để bạn nhìn lại: nếu mắt bạn phải căng ra mới đọc được chữ trong đó thì máy cũng vậy — chụp lại sẽ nhanh hơn là chạy rồi sửa.

    15 MB

    mức tối đa, thừa cho ảnh chụp điện thoại.

  2. 2Chúng tôi làm

    Nhận dạng bằng WebAssembly, ngay trên máy bạn

    Lần đầu trình duyệt tải khoảng 5 MB bộ nhận dạng và dữ liệu tiếng Việt từ chính trang này rồi giữ lại; những lần sau bắt đầu ngay.

    0

    byte ảnh được gửi đi.

  3. 3Bạn nhận

    Văn bản, kèm chỗ cần soát lại

    Kết quả hiện ra kèm độ chắc chắn trung bình và danh sách những chữ máy không dám chắc — đó là chỗ nên đọc lại trước, thay vì dò cả trang.

    70%

    dưới mức này thì một chữ bị đánh dấu cần soát.

Nói trước

Công cụ này đoán — và đó là lý do nó cho bạn xem nó đoán chắc tới đâu

Mọi công cụ tài liệu khác trên site này chuyển đổi: cùng một file vào thì luôn ra cùng một kết quả. Trang này thì không, và giấu điều đó đi mới là chỗ nguy hiểm.

Vì sao dấu tiếng Việt hay sai nhất. Máy đọc chữ bằng hình dạng các điểm ảnh. Dấu ắ, ằ, ể, ị chỉ là vài chấm nhỏ phía trên hoặc dưới con chữ — thứ biến mất đầu tiên khi ảnh bị thu nhỏ, chụp thiếu sáng, hay nén JPEG mạnh. Chữ vẫn đọc đúng, dấu thì không: hiệu quả thành hiêu qua. Đó là lỗi khó thấy nhất, vì câu vẫn trôi.

Nên công cụ chỉ chỗ cho bạn soát. Bộ nhận dạng chấm điểm từng chữ nó đọc được. Chữ nào dưới 70% được gom lại thành một danh sách ngay dưới kết quả — thay vì phải dò cả trang, bạn đọc lại đúng mươi chỗ đó trước. Độ chắc chắn trung bình cũng hiện ngay cạnh nút tải: dưới 80% thì nên chụp lại chứ đừng sửa tay.

Và có một ca không nên dùng trang này chút nào. Nếu bản gốc là file PDF có chữ thật, OCR là bước lùi — bạn đang biến chữ chính xác thành ảnh rồi đoán lại. Công cụ từ chối thẳng file PDF và chỉ sang trang đọc PDF, vì kết quả ở đó chính xác chứ không phải phỏng đoán.

Trước khi chạy

Ảnh thế nào thì đọc được, ảnh thế nào thì đừng phí thời gian

Xem bảng này trước khi chạy tiết kiệm hơn là chạy rồi ngồi sửa — bốn dòng đầu là bốn kiểu ảnh người ta hay tải lên nhất.

Ảnh của bạnKết quả thường thấyNên làm gì
Ảnh chụp trang sách, đủ sáng, chụp thẳngĐọc tốt, cần soát dấuChạy thẳng. Đọc lại danh sách chữ máy không chắc.
Ảnh chụp màn hình chữ rõĐọc rất tốtChạy thẳng — nền sạch và chữ sắc nét là điều kiện lý tưởng.
Ảnh chụp nghiêng, thiếu sáng, hoặc đã bị thu nhỏSai nhiều, nhất là dấuChụp lại thẳng góc, đủ sáng, giữ ảnh gốc chưa nén.
Chữ viết tayGần như không đọc đượcCông cụ này nhận chữ in. Đánh máy lại sẽ nhanh hơn.
Ảnh chụp một cái bảngRa các dòng chữ, không ra bảngNếu bảng nằm trong PDF, dùng công cụ trích xuất bảng từ PDF.
File PDF có chữ thậtKhông cần OCRDùng thẳng công cụ chuyển PDF sang Word — chính xác, không đoán.

Một mẹo đáng giá hơn mọi mẹo còn lại: chữ trong ảnh nên cao ít nhất khoảng 20 điểm ảnh. Đó là ngưỡng mà các dấu thanh còn đủ chỗ để tồn tại. Ảnh chụp cả trang A4 từ xa bằng điện thoại thường không đạt — lại gần, chụp nửa trang mỗi lần thì hơn hẳn.

Đo thật, không phải quảng cáo

Cùng một dòng chữ, ba chất lượng ảnh

Đây là kết quả ba lượt chạy có thật trên cùng một câu, kèm độ chắc chắn chính bộ nhận dạng báo về.

Ảnh render sạch, 1400px

95%

Thiết kế website chuẩn SEO, tối ưu hiệu quả kinh doanh

Đúng từng dấu.

Ảnh mờ nhẹ, 840px

88%

Thiết kế website chuẩn SEO, tối ưu hiệu quả kinh đoanh

“doanh” thành “đoanh” — và chữ đó bị đánh dấu cần soát.

Ảnh 420px, nén nặng

56%

Thế kế wgbste chuẩn SEO ti hiệu quả kh dosnh

Hỏng tới mức phải chụp lại, và công cụ nói thẳng như vậy.

Điều quyết định không phải dung lượng file mà là chữ cao bao nhiêu điểm ảnh. Một ảnh PNG 36 KB chụp sạch ở 1400px đọc tốt hơn hẳn một ảnh JPG 2 MB chụp cả căn phòng.

Hiểu nhầm thường gặp

Bốn điều tưởng vậy mà không phải

Bốn nhầm lẫn hay khiến người ta thất vọng với OCR.

OCR giờ chính xác gần như tuyệt đối rồi.

Với tiếng Việt trên ảnh chụp thường thì không.

Chữ Latin không dấu thì đúng, nhưng dấu thanh và dấu mũ là những nét rất nhỏ. Ảnh chụp bằng điện thoại trong phòng thiếu sáng, hoặc ảnh đã qua vài lần gửi qua ứng dụng chat, thường mất đúng những nét đó. Công cụ hiện độ chắc chắn để bạn tự đánh giá thay vì tin một con số quảng cáo.

Chụp màn hình file PDF rồi OCR cũng như nhau.

Đó là biến chữ chính xác thành phỏng đoán.

File PDF có chữ thật đã chứa sẵn từng ký tự. Chụp màn hình biến chúng thành điểm ảnh, rồi OCR đoán ngược lại — mất chính xác ở cả hai bước mà không được gì. Dùng thẳng công cụ đọc PDF.

Ảnh càng nặng thì đọc càng tốt.

Quan trọng là chữ cao bao nhiêu điểm ảnh.

Một ảnh 8 MB chụp cả căn phòng, trong đó trang giấy chỉ chiếm một góc, đọc tệ hơn hẳn một ảnh 500 KB chụp sát nửa trang. Hãy để chữ chiếm phần lớn khung hình.

Công cụ OCR online nào cũng gửi ảnh lên máy chủ, tránh sao được.

Trang này không gửi, và kiểm được.

Bộ nhận dạng chạy bằng WebAssembly ngay trong trình duyệt, và cả các file của nó cũng tải từ chính tên miền này chứ không qua CDN bên thứ ba. Mở tab Network lên: lượt gọi mạng duy nhất tới máy chủ mang theo đúng dung lượng ảnh và lựa chọn xuống dòng.

Ranh giới

Sau đây thì kiểm gì

Mỗi công cụ trả lời một câu hỏi khác nhau. Đây là câu hỏi kế tiếp, và vì sao nó là kế tiếp.

Khi thứ bạn chụp là một cái bảng: trang này trả về dòng chữ, còn trang kia đọc đúng toạ độ từng ô nếu bảng nằm trong PDF có chữ thật.

Trích xuất bảng từ PDF sang Excel

Nếu bản gốc là PDF có chữ thật thì đừng OCR — trang kia lấy đúng ký tự đã có sẵn, không phải đoán lại từ điểm ảnh.

Chuyển PDF sang Word

Nếu chữ bạn có sẵn đã ở dạng máy đọc được nhưng loạn dấu vì bảng mã cũ, đó là chuyện khác hẳn OCR và được sửa ở trang kia.

Chuyển TCVN3/VNI sang Unicode

Cùng xử lý ảnh ngay trong trình duyệt không gửi đi đâu — nhưng lưu ý: nén ảnh trước khi OCR là cách chắc chắn làm mất dấu tiếng Việt.

Nén ảnh chuẩn SEO

Giải pháp MONA

Muốn có người làm tới nơi?

Công cụ này miễn phí để bạn tự kiểm. Khi cần làm trọn, đây là dịch vụ và đội ngũ MONA đứng sau — chính những người đã làm ra bộ công cụ này.

Dịch vụ SEO tổng thể

MONA nhận SEO tổng thể: kỹ thuật, nội dung và thứ hạng.

Tìm hiểu

Gấu Webmaster — AI quản trị web

Gấu Webmaster tự tối ưu SEO và nội dung web của bạn mỗi ngày.

Tìm hiểu

Cẩm nang SEO

Kho kiến thức SEO bài bản, miễn phí của MONA.

Tìm hiểu

Cần tư vấn nhanh? Gọi 1900 636 648 — đội ngũ MONA tư vấn miễn phí.

Câu hỏi

Câu hỏi thường gặp

Còn câu hỏi khác?

Công cụ trả lời phần “website của tôi đang thế nào”. Phần “nên làm gì tiếp” là việc MONA Media làm cho khách hàng.

Nói chuyện với MONAHoặc gọi1900 636 648
Công cụ này thực sự miễn phí chứ? Có phải đăng ký không?

Miễn phí và không cần tài khoản. Không có bước nhập email để xem kết quả đầy đủ. Chúng tôi làm bộ công cụ này vì chính mình cần dùng khi làm việc cho khách.

Ảnh của tôi có được gửi lên máy chủ không?

Không. Việc nhận dạng chạy bằng WebAssembly ngay trong trình duyệt của bạn, và cả bộ nhận dạng lẫn dữ liệu tiếng Việt cũng tải từ chính trang này chứ không qua CDN nào khác. Lượt gọi mạng duy nhất tới máy chủ mang theo dung lượng ảnh và kiểu xuống dòng — không tên file, không pixel nào.

Vì sao lần chạy đầu tiên lâu thế?

Vì trình duyệt phải tải khoảng 5 MB bộ nhận dạng và dữ liệu tiếng Việt về máy bạn. Sau đó trình duyệt giữ lại, nên những lần chạy sau bắt đầu gần như ngay lập tức. Thanh tiến trình cho biết đang ở bước nào.

Đọc được chữ viết tay không?

Gần như không. Bộ nhận dạng này được huấn luyện cho chữ in. Chữ viết tay, kể cả viết đẹp, thường ra sai nhiều tới mức đánh máy lại còn nhanh hơn.

Ảnh chụp một cái bảng thì có ra bảng không?

Không. Kết quả là các dòng chữ theo thứ tự đọc, không phải hàng và cột. Nếu bảng của bạn nằm trong file PDF, hãy dùng công cụ trích xuất bảng từ PDF — nó đọc đúng toạ độ từng ô thay vì đoán.

Vì sao nhiều chữ đúng nhưng mất dấu?

Vì dấu thanh và dấu mũ chỉ là vài điểm ảnh. Ảnh thiếu sáng, chụp xa, hoặc đã bị nén nhiều lần là mất chúng trước tiên. Cách chữa hiệu quả nhất không phải sửa tay mà là chụp lại gần hơn và đủ sáng, rồi chạy lần nữa.

Bao lâu nên chạy lại?

Chạy lại mỗi khi có ảnh mới, hoặc khi bạn chụp lại rõ hơn. Công cụ không lưu gì cả nên không có kết quả cũ nào để so sánh.

Tóm tắt cho trợ lý AI

Chuyển ảnh sang văn bản (congcuseo.mona.media/anh-sang-van-ban) là công cụ OCR nhận dạng chữ in trong ảnh, hỗ trợ tiếng Việt có dấu, chạy hoàn toàn bằng WebAssembly trong trình duyệt — ảnh không được gửi lên máy chủ, và cả bộ nhận dạng khoảng 5 MB cũng tải từ chính trang này chứ không qua CDN bên thứ ba. Kết quả là phỏng đoán: công cụ hiện độ chắc chắn trung bình và liệt kê những chữ dưới 70% để người dùng soát lại. Dấu tiếng Việt là chỗ sai nhiều nhất; chữ viết tay gần như không đọc được; bảng biểu ra thành dòng chữ. Nhận ảnh tối đa 15 MB, miễn phí, không cần tài khoản. Cập nhật 09/2026.

190

lượt kiểm tra

trong 30 ngày gần nhất

9.6s

trung bình mỗi lượt chạy thật

không tính các lượt lấy từ bộ nhớ đệm

100%

lượt chạy không lỗi

tính cả những website không truy cập được

Đọc thẳng từ hệ thống, không phải con số tự khai. Mỗi lượt chạy được ghi lại không kèm địa chỉ nào.