Cách dịch tệp PDF được quét khi văn bản không thể chọn được
Nếu bạn không thể chọn các từ trong tệp PDF, có thể bạn đang làm việc với một tệp PDF được quét. Điều đó có nghĩa là mỗi trang được lưu trữ dưới dạng hình ảnh. Để dịch nó, bạn cần thêm một bước nữa: OCR trước, dịch sau.
OCR, viết tắt của nhận dạng ký tự quang học, biến văn bản dựa trên hình ảnh thành văn bản có thể đọc được bằng máy. Khi văn bản đã được nhận dạng, công cụ dịch có thể chuyển đổi nó sang ngôn ngữ khác và, tùy thuộc vào công cụ, giữ lại một phần bố cục gốc.
Hướng dẫn này chỉ cho bạn cách dịch một tệp PDF được quét mà không cần phải mò mẫm qua năm ứng dụng khác nhau. Bạn sẽ học cách kiểm tra xem tệp PDF của mình có cần OCR hay không, cách sử dụng công cụ dịch PDF được quét trực tuyến, khi nào phần mềm OCR trên máy tính để bàn an toàn hơn và cách tránh các vấn đề định dạng phổ biến khiến tài liệu đã dịch khó sử dụng.

Trả lời nhanh: Cách dịch tệp PDF được quét
Để dịch một tệp PDF được quét, hãy sử dụng quy trình sau:
- Mở tệp PDF và thử chọn một câu.
- Nếu không thể chọn văn bản, hãy chạy OCR trên tệp PDF.
- Dịch văn bản đã được nhận dạng hoặc tải tệp đã sẵn sàng OCR lên công cụ dịch tài liệu.
- Xem lại tên, số, bảng, dấu và tiêu đề theo cách thủ công.
- Tải xuống tệp đã dịch và so sánh với bản gốc trước khi chia sẻ.
Đối với một tệp PDF được quét đơn giản dưới 10 MB, tùy chọn nhanh nhất thường là công cụ dịch tài liệu trực tuyến có hỗ trợ OCR. Đối với các tài liệu pháp lý, y tế, tài chính hoặc bảo mật, hãy sử dụng quy trình làm việc chuyên nghiệp hoặc phần mềm OCR trên máy tính để bàn và nhờ người kiểm tra lại kết quả.
Đầu tiên, kiểm tra xem tệp PDF là bản quét hay bản kỹ thuật số
Trước khi chọn công cụ, hãy thực hiện một bài kiểm tra 10 giây.
Mở tệp PDF trong trình duyệt, Preview, Adobe Acrobat hoặc bất kỳ trình đọc PDF nào. Thử kéo con trỏ qua một câu.
Nếu bạn có thể tô sáng từng từ, tệp đó là PDF kỹ thuật số. Bạn thường có thể dịch trực tiếp.
Nếu toàn bộ trang hoạt động như một hình ảnh phẳng, hoặc con trỏ của bạn không thể chọn văn bản, thì tệp PDF đó đã được quét. Bạn cần OCR trước khi dịch.
Sự khác biệt này rất quan trọng vì nhiều công cụ dịch có thể tải lên tệp PDF, nhưng chúng có thể chỉ dịch văn bản đã tồn tại bên trong tài liệu. Một trang được quét có thể trông giống như một tệp PDF bình thường nhưng vẫn không thể đọc được đối với công cụ dịch.
Phương pháp 1: Sử dụng công cụ dịch PDF được quét trực tuyến
Đối với các tài liệu hàng ngày, cách đơn giản nhất là sử dụng công cụ dịch trực tuyến hỗ trợ tải lên PDF và OCR. Điều này hoạt động tốt cho các tài liệu phát tay trong lớp học, biểu mẫu du lịch, hướng dẫn sử dụng sản phẩm, chứng chỉ đơn giản, ghi chú nội bộ và các trang nghiên cứu mà bạn chủ yếu cần một bản dịch dễ đọc.
Công cụ Dịch tài liệu của Lynote hỗ trợ các tệp PDF, DOCX, PPTX và XLSX, bao gồm OCR cho các tệp PDF được quét, hỗ trợ hơn 135 ngôn ngữ và xử lý các tệp dưới 10 MB. Hãy sử dụng nó khi bạn muốn một quy trình làm việc tải lên-tải xuống trực tiếp thay vì sao chép văn bản OCR theo cách thủ công vào một công cụ dịch riêng biệt.
Bước 1: Tải lên tệp PDF đã quét
Chọn chế độ tải tài liệu lên và tải tệp PDF của bạn lên. Nếu bản quét bị nghiêng, mờ, quá tối hoặc có nhiều bóng, hãy làm sạch nó trước nếu có thể. OCR đáng tin cậy hơn nhiều khi các chữ cái sắc nét và trang thẳng.

Các ứng viên tốt cho dịch OCR trực tuyến:
- tài liệu được gõ;
- bản quét sạch từ ứng dụng máy quét;
- các trang một cột đơn giản;
- tài liệu phát tay ở trường;
- hướng dẫn sử dụng, báo cáo và biểu mẫu có văn bản dễ đọc.
Các ứng viên yếu:
- chữ viết tay;
- tài liệu có nhiều dấu;
- văn bản rất nhỏ;
- các trang bị xoay;
- bản photocopy cũ có nhiễu;
- bảng phức tạp mà bố cục chính xác quan trọng.
Nếu tài liệu chứa thông tin cá nhân, pháp lý hoặc y tế nhạy cảm, hãy kiểm tra chính sách của tổ chức bạn trước khi tải lên bất kỳ công cụ trực tuyến nào.
Bước 2: Chọn ngôn ngữ đích
Đặt ngôn ngữ nguồn thành tự động phát hiện nếu bạn không chắc chắn, sau đó chọn ngôn ngữ đích. Nếu bản quét chứa hai ngôn ngữ trên cùng một trang, hãy xem xét kết quả cẩn thận hơn vì OCR và dịch thuật có thể xử lý các phần ngôn ngữ hỗn hợp không đồng đều.

Để có kết quả tốt nhất, hãy tránh dịch một bản quét kém chất lượng sang một ngôn ngữ có độ dài câu rất khác mà không kiểm tra bố cục. Ví dụ, dịch một biểu mẫu nhỏ gọn sang tiếng Đức hoặc một bảng hẹp sang tiếng Anh có thể gây ra ngắt dòng hoặc thay đổi khoảng cách.
Bước 3: Tải xuống và xem lại bản dịch
Sau khi dịch xong, hãy tải xuống kết quả và so sánh với bản gốc. Đừng chỉ kiểm tra trang đầu tiên. Lỗi OCR thường xuất hiện ở những nơi mọi người bỏ qua: chú thích cuối trang, ô bảng nhỏ, tiêu đề trang, tên, ngày tháng và số.
Sử dụng danh sách kiểm tra này:
- Tên, địa chỉ, ngày tháng và số có đúng không?
- Các bảng có giữ nguyên ý nghĩa hàng và cột không?
- Tiêu đề, chú thích cuối trang và dấu có được dịch hoặc vẫn hiển thị không?
- Có từ nào bị tách sai do ngắt dòng không?
- Tệp đã dịch có giữ đủ bố cục cho mục đích của bạn không?
Nếu bạn cần một phiên bản kinh doanh hoặc chính thức hoàn chỉnh, hãy coi kết quả trực tuyến là bản nháp và gửi nó để người kiểm tra lại.
Phương pháp 2: OCR trước, sau đó dịch
Nếu công cụ của bạn không thể dịch trực tiếp tệp PDF đã quét, hãy chia công việc thành hai bước.
Đầu tiên, sử dụng công cụ OCR để chuyển đổi tệp PDF đã quét thành văn bản có thể tìm kiếm hoặc tài liệu có thể chỉnh sửa. Adobe Acrobat, ABBYY FineReader, Microsoft Lens và các công cụ OCR khác có thể giúp ích. Sau đó, dán văn bản đã trích xuất vào công cụ dịch, hoặc lưu kết quả OCR dưới dạng tài liệu và tải lên công cụ dịch PDF/tài liệu.
Cách này tốt hơn khi:
- chất lượng bản quét thấp;
- bạn cần sửa văn bản OCR trước khi dịch;
- tài liệu có nhiều bảng;
- bạn cần làm việc ngoại tuyến;
- bạn cần kiểm soát quyền riêng tư chặt chẽ hơn;
- bạn muốn giữ một bản sao có thể chỉnh sửa để sử dụng sau này.
Mất nhiều thời gian hơn, nhưng nó cho bạn nhiều quyền kiểm soát hơn. Đối với các tài liệu quan trọng, việc kiểm soát thêm đó thường đáng giá.
Google có thể dịch tệp PDF đã quét không?
Google Dịch có thể xử lý nhiều tài liệu tải lên, nhưng các tệp PDF đã quét là trường hợp khó. Nếu tệp PDF chỉ chứa hình ảnh, văn bản có thể không dịch đúng trừ khi OCR đã nhận dạng nó.
Quy tắc thực tế rất đơn giản: nếu Google Dịch cho bạn kết quả trống, văn bản hình ảnh không được dịch hoặc định dạng bị hỏng, hãy OCR tệp PDF trước. Sau khi OCR, bạn có thể thử lại Google Dịch hoặc sử dụng công cụ dịch tài liệu được xây dựng cho các tệp đã tải lên.
Nếu mục tiêu của bạn là so sánh các tùy chọn của Google, hãy xem hướng dẫn liên quan này về cách dịch tệp PDF bằng Google.
Cách cải thiện độ chính xác của OCR trước khi dịch
Hầu hết các vấn đề dịch PDF được quét bắt đầu trước khi dịch. Công cụ OCR không thể dịch những gì nó không thể đọc.
Cải thiện tệp nguồn trước:
- làm thẳng các trang bị nghiêng;
- cắt bỏ các đường viền, ngón tay hoặc bóng;
- quét lại ở độ phân giải cao hơn nếu có thể;
- tách các bản quét hai trang thành các trang đơn;
- tránh các bức ảnh chụp ở góc nghiêng;
- xóa các hạn chế mật khẩu nếu bạn sở hữu tài liệu và được phép chỉnh sửa nó;
- chỉ nén sau khi OCR nếu việc nén làm mờ văn bản.
Nếu bản quét là ảnh của một trang, ứng dụng máy quét thường có thể cải thiện độ tương phản và làm thẳng hình ảnh trước khi bạn chuyển đổi nó sang PDF.
Cách giữ nguyên bố cục khi dịch tệp PDF đã quét
Việc giữ nguyên bố cục là phần khó. OCR có thể nhận dạng văn bản và dịch thuật có thể chuyển đổi ý nghĩa, nhưng các từ đã dịch có thể không vừa với cùng một không gian vật lý.
Đây là lý do tại sao các biểu mẫu, bảng, tài liệu quảng cáo, hợp đồng, chứng chỉ và báo cáo nhiều cột cần được xem xét thêm. Một câu đã dịch có thể dài hơn bản gốc. Một nhãn bảng có thể bị xuống dòng. Một con dấu hoặc chữ ký có thể vẫn là hình ảnh. Một chú thích cuối trang có thể di chuyển.
Đối với các tài liệu nhạy cảm về bố cục, hãy sử dụng thứ tự này:
- OCR tệp PDF đã quét.
- Dịch tài liệu.
- So sánh tệp đã dịch với bản gốc từng trang một.
- Sửa các bảng, nhãn, tên và ngắt dòng theo cách thủ công.
- Chỉ xuất tệp PDF cuối cùng sau khi xem xét.
Nếu bố cục trực quan quan trọng hơn tốc độ, hãy sử dụng OCR trên máy tính để bàn hoặc quy trình dịch chuyên nghiệp thay vì dựa vào chuyển đổi trực tuyến nhanh chóng.
Bạn nên chọn phương pháp nào?
| Tình huống | Phương pháp tốt nhất | Lý do |
|---|---|---|
| Bạn cần một phiên bản dễ đọc nhanh chóng | OCR trực tuyến + dịch thuật | Cách nhanh nhất cho các tài liệu đơn giản |
| Bạn cần giữ nguyên định dạng tệp gốc | Trình dịch PDF AI hoặc trình dịch tài liệu | Tốt hơn là sao chép văn bản vào một trang trống |
| Bản quét lộn xộn | OCR trước, sau đó sửa văn bản thủ công | Bản dịch sẽ chỉ tốt như văn bản được nhận dạng |
| Tài liệu là bí mật | OCR ngoại tuyến hoặc công cụ nội bộ được phê duyệt | Giảm rủi ro tải lên và tuân thủ |
| Tài liệu là pháp lý, y tế hoặc chính thức | Xem xét dịch thuật chuyên nghiệp | Độ chính xác quan trọng hơn tốc độ |
| Tệp lớn hoặc nhiều tệp PDF cùng lúc | Quy trình làm việc OCR trên máy tính để bàn | Kiểm soát nhiều hơn đối với các trang và lô |
Đối với hầu hết các trường hợp sử dụng thông thường, hãy bắt đầu với quy trình trực tuyến trực tiếp. Nếu kết quả lộn xộn, đừng tiếp tục thử lại cùng một nút dịch. Hãy sửa bản quét hoặc văn bản OCR trước.
Những lỗi thường gặp cần tránh
Lỗi phổ biến nhất là tải lên một tệp PDF chỉ chứa hình ảnh cho một công cụ dịch thông thường và cho rằng công cụ đó sẽ đọc được. Một số công cụ làm được; một số thì không. Luôn kiểm tra xem OCR có phải là một phần của quy trình làm việc hay không.
Lỗi thứ hai là tin tưởng vào kết quả mà không kiểm tra tên và số. OCR thường nhầm lẫn các ký tự tương tự, đặc biệt là trong văn bản nhỏ. Một đoạn văn đã dịch có thể trông trôi chảy nhưng vẫn chứa ngày, mã hoặc tên sai.
Lỗi thứ ba là cố gắng giữ nguyên bố cục hoàn hảo từ một bản quét kém chất lượng. Nếu bản gốc bị lệch hoặc mờ, tệp đã dịch có thể sẽ cần được chỉnh sửa thủ công.
Lỗi thứ tư là sử dụng các công cụ trực tuyến cho các tài liệu không nên rời khỏi thiết bị hoặc tổ chức của bạn. Tiện lợi là tốt, nhưng quy tắc riêng tư phải được ưu tiên hàng đầu.
Câu hỏi thường gặp: Dịch tệp PDF đã quét
Làm cách nào để dịch tài liệu đã quét?
Sử dụng OCR để nhận dạng văn bản trước, sau đó dịch văn bản đã nhận dạng hoặc tải tệp đã sẵn sàng OCR lên công cụ dịch tài liệu. Nếu bạn sử dụng một công cụ có OCR tích hợp, các bước OCR và dịch thuật có thể diễn ra trong một quy trình làm việc.
Tại sao tôi không thể sao chép văn bản từ tệp PDF đã quét của mình?
Bởi vì tệp PDF có thể lưu trữ mỗi trang dưới dạng hình ảnh. Một trình đọc PDF thông thường có thể hiển thị trang, nhưng nó không thể chọn các từ cho đến khi OCR biến văn bản hình ảnh thành văn bản có thể đọc được bằng máy.
Tôi có thể dịch tệp PDF đã quét miễn phí không?
Một số công cụ trực tuyến cung cấp OCR hoặc dịch tài liệu miễn phí với các giới hạn. Hãy kiểm tra kích thước tệp, số trang, hỗ trợ ngôn ngữ, yêu cầu đăng ký và liệu kết quả đầu ra có giữ nguyên định dạng hay không trước khi tin dùng.
OCR có giữ nguyên định dạng gốc không?
OCR nhận dạng văn bản; nó không đảm bảo bố cục hoàn hảo. Một số công cụ cố gắng giữ nguyên phông chữ, hình ảnh, bảng và khoảng cách, nhưng các tài liệu phức tạp vẫn cần được xem xét thủ công.
Cách tốt nhất để dịch tệp PDF đã quét có bảng là gì?
Sử dụng OCR trước, sau đó kiểm tra các ô bảng theo cách thủ công sau khi dịch. Nếu ý nghĩa hàng và cột quan trọng, hãy tránh sao chép văn bản thuần túy vào công cụ dịch vì nó có thể phá hủy cấu trúc bảng.
Tôi có thể dịch các tệp PDF đã quét viết tay không?
Chữ viết tay khó hơn nhiều so với văn bản in. OCR có thể hoạt động với chữ viết tay rõ ràng, nhưng độ chính xác thường thấp hơn. Đối với các tài liệu viết tay quan trọng, sao chép thủ công và dịch thuật bởi con người an toàn hơn.
Có an toàn khi tải tệp PDF đã quét lên công cụ dịch trực tuyến không?
Điều đó phụ thuộc vào tài liệu và quy tắc của bạn. Đối với ghi chú học tập, tài liệu phát tay công cộng hoặc tài liệu không nhạy cảm, các công cụ trực tuyến có thể ổn. Đối với hợp đồng, giấy tờ tùy thân, hồ sơ y tế, hồ sơ tài chính hoặc tài liệu công việc bảo mật, hãy sử dụng quy trình làm việc an toàn đã được phê duyệt.
Kết luận
Để dịch một tệp PDF đã quét, đừng bắt đầu bằng bước dịch. Hãy bắt đầu bằng cách kiểm tra xem tệp PDF có văn bản có thể chọn được hay không. Nếu không, OCR là bước còn thiếu.
Đối với các tài liệu đơn giản, công cụ dịch PDF đã quét trực tuyến có thể tiết kiệm thời gian. Đối với các bản quét lộn xộn, tệp nhạy cảm hoặc tài liệu quan trọng về bố cục, hãy OCR trước, xem xét cẩn thận và sử dụng quy trình làm việc được kiểm soát hơn.
Kết quả tốt nhất thường đến từ một quy trình nhàm chán: quét sạch, OCR chính xác, dịch cẩn thận và kiểm tra cuối cùng bởi con người.
Viết bởi Janet L. Harris
Chuyên gia Viết AI
Janet đánh giá các công cụ phát hiện và nhân hóa AI, tập trung vào độ chính xác, giới hạn và cách sử dụng có trách nhiệm. Xem mọi bài viết →


