Cara membuat PDF hasil scan bisa dicari
PDF yang bisa dicari tetap menampilkan gambar halaman, dengan lapisan teks OCR di belakangnya. Lapisan tersebut perlu diperiksa sebelum digunakan.
Uji teks yang sudah ada
Cari satu kata yang terlihat pada halaman, lalu pilih dan salin satu kalimat ke editor teks polos. Jika pilihan mengikuti kata dan hasil salinannya benar, PDF sudah memiliki lapisan teks.
Uji beberapa halaman, termasuk angka dan tanda baca. OCR lama dapat membaca judul tetapi melewatkan isi, atau menempatkan teks di lokasi yang salah. Ambil contoh dari halaman awal, tengah, dan akhir, serta dari bagian dengan kolom, tabel, atau jenis huruf yang berbeda.
Ketahui hasil OCR
OCR membaca piksel dan menambahkan teks tak terlihat di atas gambar halaman. Tampilan PDF dapat terlihat sama meskipun teks yang disalin masih salah.
PDF yang bisa dicari belum tentu bisa diedit atau aksesibel. Dokumen aksesibel juga memerlukan urutan baca, bahasa, judul, tabel, dan keterangan gambar yang tepat.
Siapkan halaman untuk OCR
Putar halaman ke arah yang benar, luruskan perspektif, dan pastikan tulisan tajam dengan kontras merata. Jangan menaikkan kontras terlalu jauh karena tanda baca, garis tabel, atau catatan pensil dapat hilang.
Pilih bahasa yang sesuai. Nama orang, kode, singkatan, teks campuran bahasa, dan cetakan lama sering tetap memerlukan koreksi manual.
Periksa lapisan teks
Cari kata pada setiap jenis halaman. Salin paragraf, angka, dan sel tabel yang mewakili, lalu pastikan urutannya mengikuti tampilan. Pada dokumen berkolom, periksa agar teks tidak berpindah dari satu kolom ke kolom lain.
Untuk dokumen yang memuat hak, uang, identitas, atau kewajiban, bandingkan setiap nilai penting dengan gambar sumber. Skor OCR bukan pengganti pemeriksaan isi. Jika teks akan dimasukkan ke sistem lain, lakukan pemeriksaan setelah salin-tempel karena urutan baris dapat berubah saat diekstrak.
- Nama, tanggal, nominal, dan nomor referensi sesuai dengan halaman.
- Kata di ujung baris tidak rusak saat disalin.
- Kolom dibaca dalam urutan yang benar.
- Sensor permanen juga menghapus teks tersembunyi.
- PDF dapat dicari di aplikasi pembaca lain.
Jaga ukuran dan keterbacaan
Lapisan teks OCR biasanya kecil; gambar halaman yang paling banyak menentukan ukuran file. Kompres secukupnya dan periksa huruf terkecil. Mengubah halaman menjadi gambar berulang kali dapat menghilangkan tautan, formulir, tag, dan teks digital.
Simpan salinan berkualitas sumber terpisah dari versi kecil untuk dibagikan. Jangan jadikan hasil kompresi sebagai satu-satunya salinan dokumen penting.
Bedakan sumber dan hasil
Simpan hasil scan utuh sebagai sumber. Beri nama jelas pada versi yang sudah diberi OCR dan buka kembali di aplikasi lain untuk menguji pencarian serta pemilihan teks.
Untuk arsip jangka panjang, catat tanggal pembuatan dan halaman yang sudah diperiksa. Cara ini mencegah file kerja dianggap sebagai sumber asli.
Sumber resmi
Sumber diperiksa pada 14 Agustus 2026 dan mendukung keterangan teknis atau prosedural di panduan ini.