Problem
An einem Sonntag im Jahr 2023 saß ich im Wohnzimmer und staunte über die Berge an Bilderbüchern für unsere Kinder. Vorgelesen wurden trotzdem immer dieselben drei, und eine Geschichte, in der das eigene Kind vorkommt, war in keinem der Stapel dabei.
Lösung
Ein Stichwort genügt — „Emilia reist mit einem Einhorn nach Italien". Das System erkennt, welche Charaktere unbekannt sind, fragt nach dem Aussehen oder liest es aus einem hochgeladenen Bild, schreibt die Geschichte in zehn Abschnitten, erzeugt zu jedem Abschnitt ein Bild und spricht die Kapitel mit einer Stimme ein, die sich auch klonen lässt. Geschichten, Charaktere und die Pfade zu Bildern und Audiodateien liegen in einer DuckDB, die Oberfläche ist Streamlit. So lässt sich ein einmal erzeugtes Buch jederzeit wieder aufschlagen.
Ergebnis
Ein Prototyp, den unsere Kinder tatsächlich benutzt haben. Kein fertiges Produkt und auch keins geplant, aber das Projekt, in dem Text-, Bild- und Sprachgenerierung bei mir zum ersten Mal in einer Anwendung zusammengekommen sind — und damit die Grundlage für alles, was danach kam.