Resimden Yazı Çıkarma (OCR)
Bir fotoğraf, ekran görüntüsü veya taranmış PDF seçin; tanınan metin kopyalamaya hazır görünür. Tanıma, açık kaynaklı Tesseract motoruyla cihazınızda çalışır.
Tanıma tarayıcınızda çalışır. Motor ve dil modeli ilk kullanımda bir CDN'den alınır; dosyalarınız asla yüklenmez.
Bu araç hakkında
Optik karakter tanıma, metin görüntülerini düzenlenebilir metne dönüştürür: bir sayfanın fotoğrafı, hata mesajının ekran görüntüsü, taranmış bir sözleşme. Bu araç, açık kaynaklı OCR motoru Tesseract'ı WebAssembly'ye derlenmiş halde tarayıcınızda çalıştırır. Motor ve seçtiğiniz dilin modeli ilk kullanımda bir içerik dağıtım ağından indirilip önbelleğe alınır; görselleriniz yerel olarak işlenir ve asla yüklenmez.
Doğruluk girdiye bağlıdır: modelin bildiği bir dilde keskin, dik ve yüksek kontrastlı metin neredeyse kusursuz okunurken düşük çözünürlüklü fotoğraflar, el yazısı ve süslü yazı tipleri hızla bozulur. Taranmış PDF'lerde her sayfa sırayla çizilir ve tanınır. Doğru dili seçmek önemlidir; model belirsiz karakterleri çözmek için sözlüğünü kullanır.
Sık sorulan sorular
- Görsellerim yükleniyor mu?
- Hayır. Tanıma tarayıcınızda gerçekleşir. Yalnızca OCR motoru ve dil verileri bir CDN'den alınır; bunlar size ait hiçbir şey içermez.
- İlk çalıştırma neden yavaş?
- Birkaç megabaytlık motor ve dil modeli bir kez indirilir. Sonraki çalıştırmalar önbellekten yararlanır.
- El yazısı okuyor mu?
- Nadiren. Tesseract basılı metinle eğitilmiştir; düzgün büyük harfler bazen çalışır, el yazısı çalışmaz.
- Doğruluğu nasıl artırırım?
- Metni dik ve en az 30 piksel yüksekliğinde keskin bir görsel kullanın, gereksiz kısımları kırpın ve doğru dili seçin.