Wie arbeiten KI-Text-Erkennungstools, woran scheitern sie erstaunlich oft und wie läuft die Erkennung bei Bildern und Musik?