2026-08-24 · 3 Min. Lesezeit

Neuronaler OCR auf dem Smartphone: CRAFT, CRNN, EasyOCR und ExecuTorch

Optische Zeichenerkennung (OCR) basiert heute immer weniger auf klassischen Bildfiltern und immer mehr auf tiefen neuronalen Netzen. In mobilen Apps ist eine zweistufige Verarbeitungskette üblich: Ein Detektor findet die Textstellen, und ein Recognizer wandelt die Bildinhalte in lesbaren Text um. EasyOCR hat dieses Muster populär gemacht, und dieselbe Architektur lässt sich mit der Laufzeit ExecuTorch vollständig auf dem Smartphone ausführen. Dieser Artikel behandelt die Rollen von CRAFT und CRNN, die wichtigsten Bildgrößenlimits und den praktischen Portierungsweg.

CRAFT und CRNN: die typische neuronale Paarung

CRAFT ist ein Textdetektionsmodell mit dem vollen Namen Character Region Awareness for Text Detection. Statt nur grobe Wortboxen vorherzusagen, erzeugt es eine Regionenkarte für einzelne Zeichen und zusätzlich eine Affinitätskarte. Diese Karte verbindet benachbarte Zeichen, die zu demselben Wort gehören. Dadurch lassen sich gedrehte, gekrümmte oder irreguläre Schriftzüge erkennen, die herkünftliche Objektdetektoren oft schwer tun.

Die CRNN, ein Convolutional Recurrent Neural Network, über den deutschen Teil. Ein Faltungsnetzwerk wie VGG oder ResNet extrahiert aus dem Textpatch Fichtiger. Anschließend verarbeitet ein bidirektionales LSTM diese Merkmale als Sequenz. Ein CTC-Decoder erzeugt die finale Buchstabenstruktur, ohne dass jedes Zeichen manuell al allein existiert. Dieses Vorgehen ist besonders für kurze Banner- oder Papierfotos auf dem Handy geeignet.

Bildgrößenbegrenzungen und mobile Zwänge

Mobiles hat nur begrenzte Betrieb Speichernehm, Wärme und Energie müssen haushalten. Ein 12-Megapixel-Kamerabild kann nicht nigrig ein direkt in den CRAFT-Modell geschoben werden, weil die Zwischendaten zu groß sind würde. Man verwickelt den Eingang deshalb in der Regel auf die lange Seitenlänge von 512, 768 oder 960 Pixel und füllt den Rest mit Nullen auf.

Hinzu komme Fixierung der Modelleingänge. Ähnlich wie die meisten mobilen Frameworks exportiert ExecuTorch Model oft mit festen Eingangsdimensionen. Das Modell wurde für eine konkrete Vektorform compiliert; wechselt man zur Laufzeit die Größe, müssen es neu compiliert werden. CRAFT bekommt man daher zumeist mit quadratischem Eingang, zum Beispiel 1,3,768,768; die CRNN nutzt inline Eingabewerte mit fester Höhe von 32 Pixieren und wählbarer Breite von 128, 256 oder 512.

Um die Dauer zu sparen, kann vorgeschaltet ein leistungsschnell utensils Dateien werden. Ein einfacher Kantendetektor oder eine Signalvorverarbeitung sucht nach textenden Bildausschnitten. Nur diese Testausschnitte gehen in CRAFT und CRNN ein, sodass nicht jede Schritte ein volles Frameneuer Neuron muster bewertet werden. Das spart viel Rechenzeit.

Vom EasyOCR-Ansatz zu ExecuTorch

EasyOCR ist eine PyTorch-basierte Python-Bibliothek, die als Compose aus CRAFT und einem CRNN. Der große Vorteil bei ExecuTorch liegt darin, dass die Modelle im nativen PyTorch-Format bleiben. Eine Konversion zu ONNX oder TFLite entfällt. Damit lassen sich Fehler durch abweichende Operatorstände vermeiden und die Modellqualität bleibt vollständig erhalten.

Zuerst exportiert man das passende CRAFT-Modell mit einer stabilen Dingvackages und quantisiert es auf float16 oder int8. Das verkleinert die Modelldatei und beschleunigt auf einer NPU. Weiter drei kann aus dem CRNN-Backbone exportiert, eine Variante für 128, 256 und 512 raus. Die Anwendung wählt die richtige Variante anhand der Textlänge.

In der App übernimmt der Entwickler dann die Unterrichtslogik: Camera-Image laden, skalieren, padden, CRAFT localizen, Karten analysieren, Tex-Boxen ableiten, schneiden und der CRNN übergeben. Der CTC-Decoder schreibt das Ergebnis als String zurück. Everything runs on-Gerät, die verzögert, ist niedrig und die Persönlichkeitsdaten bleiben lokal.

Vergleich der Aufgaben in einer mobilen OCR-Pipeline
AspektCRAFTCRNN
AufgabeTextdetectionTexterkennung
AusgabeZeichenkarte + AffinitätZeichenfolge
EingabeFeste QuadratgrößeFeste Höhe, variable Breite
AufwandHochMittel bei kleinen Ausschnitten
← Nach rechts scrollen für mehr →

Zusammengefasst sind CRAFT und CRNN eine modellplantige Grundlage für neuronales OCR im Taschenformat. Bildgrößen, Speicher und Wärmlimite stehen im Wege, aber mit gezielter Regionierung, Skalierung, Padding, Testausschnitt und Abmessung lassen sich alle Hürden elegant überwinden. Kombination mit EasyOCR-Referenz und ExecuTorch entsteht ein offline-fähiger, echtzeit stattfindender OCR-Workflow für das Smartphone definieren.

Lassen Sie uns zusammenarbeiten

Benötigen Sie weitere Informationen, Hilfe bei Ihrem Projekt oder zur Entwicklung einer Idee?

Ob einfache Frage, kurzer Zweifel oder ein 5-Minuten-Chat, schreib mir einfach—es kostet nichts und ich helfe immer gerne. Ich liebe es, Probleme zu verstehen, kreative Lösungen zu finden und mich auf einfache, zuverlässige und unkomplizierte Ideen zu konzentrieren, die sich schnell umsetzen lassen.

Kontaktiere mich

Thema wechseln

Wählen Sie ein spezielles Thema zum Erkunden: