Re: suchen in gescannten .pdf-files
Geizhals » Forum » Wo finde ich ... ? » suchen in gescannten .pdf-files (21 Beiträge, 221 Mal gelesen) Top-100 | Fresh-100
Du bist nicht angemeldet. [ Login/Registrieren ]
.  Re: suchen in gescannten .pdf-files  (mko am 14.03.2007, 08:55:12)
..  Re(2): suchen in gescannten .pdf-files  (Chris01 am 14.03.2007, 11:11:34)
..  Re(2): suchen in gescannten .pdf-files  (Chris01 am 14.03.2007, 11:12:16)
...  Re(3): suchen in gescannten .pdf-files  (Somnatic am 14.03.2007, 11:15:12)
....  Re(4): suchen in gescannten .pdf-files  (Chris01 am 14.03.2007, 11:21:16)
.....  Re(5): suchen in gescannten .pdf-files  (Somnatic am 14.03.2007, 11:21:46)
......  Re(6): suchen in gescannten .pdf-files  (Chris01 am 14.03.2007, 11:26:34)
....  Re(4): suchen in gescannten .pdf-files  (Chris01 am 14.03.2007, 14:11:03)
.  Re: suchen in gescannten .pdf-files  (Trouble am 14.03.2007, 11:24:49)
.  Re: suchen in gescannten .pdf-files  (Ardjan am 14.03.2007, 11:40:43)
.
Re: suchen in gescannten .pdf-files
14.03.2007, 13:37:24
Gibts überhaupt irgendeine brauchbare Freeware OCR? Gut, ich mein, ich selbst benutze ab und zu GOCR, das funktioniert bei computererzeugten Textgrafiken ganz gut, wenn wirklich jeder einzelne Buchstabe bei jedem Vorkommen absolut identisch gleich aussieht, und man GOCR auf diese bestimmte Schrift etwas nachtrainiert. Aber ich wüßt nicht daß es irgendwas gibt, das z.B. mit dem ABBYY FineReader mithalten kann.

Gescannte PDF sind dann gleich nochmal ein ganz anderer Sonderfall... die meisten solcher PDFs die ich habe, sind an einem stinknormalem Fotokopierer erstellt worden, der halt das kopierte nicht als Papier ausschmeisst, sondern digitalisiert als PDF Datei. Die Qualität davon ist halt leider nicht allzu gut, man hat wie auf einer richtigen Kopie halt die üblichen Verunreinigungen, Schieflage, Biegung bei kopierten Büchern, schwarze Ränder, usw. Dann ist das ganze Bild im PDF womöglich noch verlustbehaftet komprimiert, damit die PDF Datei nicht größer wird als sie eh schon sein muß.

Also es ist echt schwierig, mit sowas sinnvoll zu arbeiten.

Wenn du eine Beispiel PDF Datei mal irgendwo hochlädst, kann ich GOCR mal drüberrennen lassen, dann kannst dir ja mal ein Bild davon machen wie weit du mit solchen Tools ohne großes Zutun kommst. Dein Wunschprogramm damit zu bauen ist trivial, ein einfaches Shellscript reicht (ImageMagick PDF in Bilddateien konvertieren, GOCR Bilddateien in Text konvertieren, Text mit Grep nach Wunschbegriff durchsuchen, gefundene Seitenzahlen ausgeben). Nur wenn GOCR keine guten Ergebnisse liefert bekommst du logischerweise auch keine Seitenzahlen raus. ;-)

Antworten PM Alle Chronologisch Zum Vorgänger
 
Melden nicht möglich
...  Re(3): suchen in gescannten .pdf-files  (juwb am 14.03.2007, 14:21:12)
..  Re(2): suchen in gescannten .pdf-files  (Chris01 am 14.03.2007, 14:14:32)
 

Dieses Forum ist eine frei zugängliche Diskussionsplattform.
Der Betreiber übernimmt keine Verantwortung für den Inhalt der Beiträge und behält sich das Recht vor, Beiträge mit rechtswidrigem oder anstößigem Inhalt zu löschen.
Datenschutzerklärung