(Flensburg /Deutschland) Ich hatte bei meinem Besuch verschiedene Hinweistafeln fotografiert.
Und in meinem zweiten Beitrag (Fotogalerie -2- ) über die Kupfermühle unter anderem auch diese Fotos eingebunden.
GEMENI KI sollte dann vollautomatisch diesen veröffentlichten Blogbeitrag ansehen und selbständig die großen Bilder (nicht nur die verkleinerten Voransichten) laden und jeweils per OCR die Texte extrahieren.
Ups…. 😱🤷
Auf der Webseite sind zwar 32 Fotofelder/Bilder eingebunden, allerdings enthalten die Bilder selbst im Quelltext der Seite keine hinterlegten Bildunterschriften, Alt-Texte oder direkt als HTML auslesbaren Textinhalte (im Quellcode finden sich lediglich Platzhalter-Grafiken für das responsive Laden).
Als KI habe ich keinen direkten Zugriff auf die visuellen Pixeldaten der Bilddateien, um den im Bild gezeigten Text (z. B. von Infotafeln oder Schilder im Museum) via OCR selbst zu lesen.
Falls du den Text bestimmter Schilder oder Tafeln benötigst, kannst du die entsprechenden Fotos hier direkt hochladen oder als Bild anhängen – dann kann ich den Text gerne aufnehmen und extrahieren!
Okay, dafür habe ich einen weiteren PRO Account, diesmal bei ChatGPT…
Durchsuchen der Seite nach Fotos der Kupfermühle
Websites durchsucht
Ich öffne den Beitrag, erfasse sämtliche eingebundenen Fotos und lese die darauf sichtbaren Texte per OCR aus. Anschließend ordne ich die Ergebnisse den einzelnen Bildern zu und kennzeichne unleserliche Stellen.
Der direkte Abruf über die Suchschnittstelle wird von der Blog-Domain blockiert. Ich weiche deshalb auf die Browser-Ansicht aus, damit ich die Originalbilder in voller Auflösung öffnen und zuverlässig auslesen kann. Dafür nutze ich die Browser-Funktion für die visuelle Seitenerfassung.
Gelesen der Browser-Fähigkeit
Vorbereiten de Browsersteuerung
Öffnete und erfasste Blogbeiträge sowie Bildinformationen
Der Beitrag enthält 31 Galerie-Figuren; die
Angabe „32 Fotos“ schließt sehr wahrscheinlich das Beitragsbild ein. Die Galerie lädt nur Platzhalter, aber die Originaldateien mit 2000 × 1126 Pixeln sind erreichbar. Ich prüfe jetzt jedes Originalfoto, damit auch kleine Museumstafeln erfasst werden.
Extrahieren und Anzeigen von Bildern aus URLS
2m 36s nachgedacht
Ich habe den Beitrag vollständig geprüft: 31 Galeriebilder plus das Beitragsbild = 32 Fotos. Nachfolgend steht der aus den Fotos extrahierte Text. Zeilenumbrüche und Trennungen habe ich bereinigt; historische Schreibweisen bleiben erhalten. Unsichere Stellen sind mit [unleserlich] gekennzeichnet.
Quelle: Besuch der Kupfermühle – Galerie 2
9m 41s nachgedacht
ChatGPT hat dann die Texte relativ gut extrahiert. Allerdings auch Bildunterschriften und teils auch dänische Texte.
Da ChatGPT immer noch nicht Texte MIT (!) Formatierungen über die Zwischenablage zu einem anderen Programm bringen kann, nutze ich dafür GEMENI KI. Siehe nächten Beitrag.

