Gast
#2065319
Hallo :) Ich habe versucht, das Anliegen schon im Titel zu beschreiben. Ausgangspunkt: Eine digitale Bibliothek mit annähernd 300 Studien- und Diplomarbeiten, Dissertationen und anderen wissenschaftlichen Arbeiten, Umfang pro Band im Schnitt 150 Seiten. Die Arbeiten (die meisten wurden vor 1990 erstellt) enthalten zum Großteil Text, zumeist mit Schreibmaschine geschrieben. Der Text ist ab und an durch Diagramme oder Formeln unterbrochen. Ganz selten sind auch mal Bilder dabei. Die Arbeiten lagen im Original oder als gute Kopie vor und wurden mit einem Hochleistungsscanner mit Einzelblatteinzug digitalisiert. Jede Arbeit besteht aus einer PDF-Datei, in der die einzelnen Seiten als Bild eingebunden sind. Was wir nun benötigen würden, wäre ein Tool, das die einzelnen Seiten untersucht und versucht, die Textblöcke mittels OCR zu erkennen. Es soll dann eine neue PDF-Datei erzeugt werden, die die Textblöcke enthält, und die Diagramme und Bilder entsprechend dazwischen einfügt. Die Anforderung wäre, dass das Programm ohne Interaktion auskommt (Kommandozeile). Am schönsten wäre es, wenn das ganze auf unserem Server (Ubuntu Linux) im Hintergrund ablaufen könnte, so dass keine Arbeitszeit gebunden wird. Vielleicht hat ja schon jemand eine ähnliche Aufgabe gelöst.