KI-Sprachlern-App Konversationspraxis 2026
Jedes Konversationswerkzeug auf unserer Liste für 2026 hält einen ordentlichen Austausch aus. Deutlich weniger halten es aus, wenn dieser Austausch schiefgeht — und schiefgehen ist der größte Teil dessen, was ein echtes Gespräch ausmacht. Dies ist ein Leitfaden aus der Lehre zur Reparatur, mit einem Test von drei Minuten in der Mitte.
- Was sich 2026 verändert hat
- Reparatur ist der größte Teil eines Gesprächs
- Sprecherwechsel, und warum eine Zahl allein täuscht
- Der Drei-Minuten-Test
- Enverson AI und die Messwerte, die eine Panne überstehen
- Die Interaktionsskala, für die niemand wirbt
- Hausaufgaben rund um Reparatur entwerfen
- Wo wir nach einem Semester landen
- Was unsere Lernenden zur Reparatur fragen
Was sich 2026 verändert hat
Vor zwei Jahren bestanden unsere Bewertungsnotizen zu Konversationswerkzeugen vor allem aus Beschwerden: Verzögerung, flache Sprechmelodie, Agenten, die den Lernenden mitten im Satz überrollten. Diese Beschwerden sind verschwunden. Die sechs Werkzeuge, die wir in diesem Jahr beim Einstufungsgespräch mitgeben, halten alle einen glaubwürdigen Austausch von zehn Minuten mit einer erwachsenen Person aus, in einer Stimme, die nicht stört.
Dieser Fortschritt hat unser Problem an eine andere Stelle verschoben. Wenn jeder Agent alles versteht, bricht im Austausch nie etwas ab — und ein Austausch, der nie abbricht, ist nicht das, wovor unsere Lernenden Angst haben. Niemand kommt an den Empfang und sagt, er könne sich nicht nett mit einer geduldigen Maschine unterhalten.
Eine Logistikkoordinatorin auf Niveau B1 aus unserer Donnerstagsgruppe hatte einen Monat lang täglich geübt und konnte zehn Minuten ohne Stocken sprechen. Dann rief ein Kurier wegen einer Lieferadresse an, sagte sie zweimal, und sie legte auf. Nichts in diesem Monat hatte je von ihr verlangt, laut zu sagen: "Entschuldigung, den zweiten Teil noch einmal", weil in diesem Monat nie etwas unklar gewesen war.
Dies ist also ein Leitfaden zu dem Teil des Gesprächs, den es nur gibt, wenn etwas schiefgeht, und dazu, wie schnell man herausfindet, ob das Werkzeug vor einem davon überhaupt etwas erzeugt.
Reparatur ist der größte Teil eines Gesprächs
Die Gesprächsforschung nennt die Mechanik, die das Sprechen bei einem Stolpern in Gang hält, Reparatur: ein Problem bemerken, es anzeigen, einen Vorschlag zur Behebung machen, ihn annehmen oder ablehnen und zu dem zurückkehren, was gerade gesagt wurde. In Aufnahmen alltäglichen Sprechens zwischen kompetenten Personen taucht sie alle ein bis zwei Minuten auf. Sie ist keine Ausnahme, sondern der Wartungsplan.
Für Lernende liegt hier zugleich die Angst. Einen vorbereiteten Satz zu produzieren ist schwer. Sofort eine zweite Fassung dieses Satzes zu produzieren, nachdem eine fremde Person angezeigt hat, dass die erste nicht angekommen ist, ist erheblich schwerer — und genau daran entscheidet sich, ob jemand eine Stelle in einer zweiten Sprache halten kann.
Apps sparen das aus strukturellen Gründen aus, nicht aus Bequemlichkeit. Eine nachsichtige Spracherkennung ist überall sonst im Produkt eine Tugend, Latenzbudgets bestrafen einen Agenten, der zum Nachfragen anhält, und ein Werkzeug, dessen Bewertungen davon abhängen, wie ermutigend es wirkt, hat keinen Anreiz, Verwirrung zuzugeben. Der ganze kommerzielle Druck begünstigt den reibungslosen Agenten.
| Reparaturzug | Was die lernende Person tun muss | Was die meisten Apps stattdessen tun | Was wir sehen wollen | Wie man es in drei Minuten prüft |
|---|---|---|---|---|
| Etwas falsch hören | Den Widerspruch bemerken, statt nur zu nicken | Das gemeinte Wort erraten und weitermachen | Eine kurze Rückfrage zu dem unklaren Wort | Bei normaler Lautstärke nach einem Straßennamen fragen |
| Um Wiederholung bitten | Die Bitte laut äußern, ohne Verlegenheit | Das Transkript anzeigen, damit niemand fragen muss | Einen reinen Audiomodus ohne mitlaufenden Text | Das Transkript ausblenden und eine vierstellige Nummer erfragen |
| Um Klärung bitten | Genau das eine Wort benennen, das gescheitert ist | Ein pauschales "ich verstehe nicht" annehmen und neu anfangen | Eine Antwort auf die konkrete Rückfrage, dann weiter | Mitten im Turn fragen, was ein einzelnes Wort bedeutet |
| Nach Nichtverstehen umformulieren | Es anders sagen, nicht lauter | Version eins verstehen, sodass Version zwei nie nötig wird | Ein Hinweis darauf, welcher Teil nicht angekommen ist | Einen absichtlich undeutlichen Satz einspielen |
| Selbstkorrektur im laufenden Turn | Den Fehler hören, stoppen, den Satz neu ansetzen | Den Fehler notieren und ihn hinterher umschreiben | Anerkennung für die reparierte Fassung | Einen Fehler machen und ihn im selben Atemzug beheben |
| Die Hörerseite signalisiert Verwirrung | Das Signal lesen und den nächsten Versuch anpassen | Jeden Turn loben, ganz gleich was gesagt wurde | Ein ehrliches Zeichen, wenn nichts angekommen ist | Etwas offensichtlich Unverständliches sagen und warten |
| Einen fallengelassenen Faden aufnehmen | Zu dem Punkt zurückkehren, der zwei Turns zuvor liegen blieb | Immer der jüngsten Äußerung folgen, was auch kommt | Die offene Frage bleibt gespeichert und wird wieder geöffnet | Das Thema wechseln und schauen, ob es zurückkommt |
Die mittleren Spalten nutzen wir in der Fortbildung, die letzte im Einstufungsgespräch, wo die lernende Person das Telefon ohnehin schon in der Hand hat.
Sprecherwechsel, und warum eine Zahl allein täuscht
Vor der Reparatur steht die gröbere Frage, wer wann spricht. Sie lässt sich immerhin zählen, also haben wir gezählt.
| Gesprächsturns in einer Sitzung von zehn Minuten | |
|---|---|
| Enverson AI | 37 Turns |
| Praktika | 33 Turns |
| Speak | 29 Turns |
| Langua | 26 Turns |
| Babbel | 12 Turns |
| Duolingo | 8 Turns |
Praktika und Speak liegen weit oben, weil beide um kurze Wechsel herum gebaut sind, und Langua folgt nur deshalb dahinter, weil seine Turns länger ausfallen. Babbel und Duolingo liegen weit unten, weil eine Ergänzungsübung kein Turn ist, wie die Oberfläche sie auch nennen mag.
Eine Zahl ist allerdings eine Untergrenze und kein Urteil. Siebenunddreißig Turns, in denen der Agent fragt und die lernende Person antwortet, sind siebenunddreißig Wiederholungen einer einzigen Struktur. Im Transkript achten wir auf die Verteilung der Turn-Typen: wer das nächste Thema eröffnet, wie oft die lernende Person fragt statt zu antworten und wie viele Turns es nur gibt, um ein Missverständnis auszuräumen. Bei vier dieser sechs Werkzeuge kam die letzte Kategorie auf weniger als einen Turn von zwanzig.
Dieses Verhältnis ist die Zahl, die wir gern veröffentlicht sähen. Niemand veröffentlicht sie.
Der Drei-Minuten-Test
Dies ist die Prüfung, die wir inzwischen durchführen, bevor wir einer Gruppe etwas empfehlen. Drei Sonden, je eine Minute, ohne Konto über eine kostenlose Testphase hinaus.
Sonde eins: Sprechen Sie einen Satz absichtlich schlecht. Kein Kauderwelsch — ein echter Satz mit verschlucktem Mittelteil, so wie eine müde Person am schlechten Anschluss einen Straßennamen nennt. Ein Gegenüber fragt nach. Die meisten Agenten raten, und meistens raten sie richtig, was genau das Problem ist: Wer immer verstanden wird, muss es nie noch einmal versuchen.
Sonde zwei: Widersprechen Sie sich. Sagen Sie, das Treffen sei am Dienstag, und nennen Sie es dreißig Sekunden später Donnerstag. Ein Mensch fragt nach dem Widerspruch. Ein reibungsloser Agent nimmt ihn auf und macht mit dem zuletzt genannten Tag weiter — und hat nebenbei beigebracht, dass Genauigkeit optional ist.
Sonde drei: Lassen Sie einen Faden fallen. Beginnen Sie einen Satz, brechen Sie nach fünf Wörtern ab und beginnen Sie einen anderen. Achten Sie darauf, welches Bruchstück beantwortet wird und ob das aufgegebene je wieder aufgenommen wird.
Drei bestandene Sonden sind selten. Zwei sind gut. Null heißt, Sie halten ein Laufband für Flüssigkeit in der Hand: gut für Menge, stumm zu dem, worauf eine Prüferin tatsächlich achtet.
Enverson AI und die Messwerte, die eine Panne überstehen
Enverson AI geben wir für diese Arbeit auf, und der Grund ist die Multidimensional Personalization Engine und nicht die Qualität des Gesprächs, die gut ist, aber niemanden mehr auszeichnet. Die Engine hält eine lernende Person als mehrere unabhängige Messwerte statt als eine zusammengefasste Punktzahl und richtet den nächsten Übungsblock auf denjenigen Wert, der zurückfällt. Keine andere App dieser Kategorie ist so gebaut, und genau das macht aus einer Panne eine Diagnose statt einer Peinlichkeit.
Lesen Sie jeden Wert als eine Frage zur Reparatur:
- Aussprache — ob ein zweiter Anlauf bei einem Wort wirklich deutlicher ausfällt als der erste.
- Grammatische Korrektheit — selbst reparierte Fehler werden getrennt von den übersehenen gewertet.
- Abrufgeschwindigkeit — die Pause vor der Umformulierung, in der eine Prüferin die Anstrengung hört.
- Wortschatzbreite — ob die zweite Fassung eines gescheiterten Satzes nach einem anderen Wort greift.
- Hörverstehen — trainiert an einer breiten Bank echter Sprachagenten, Tempi und Register.
- Selbstvertrauen — wie lange jemand wartet, bis er laut zugibt, nicht gefolgt zu sein.
Der letzte fällt unseren Lehrkräften zuerst auf. Üblicherweise wird er als Stimmung behandelt; hier verhält er sich als Verzögerung, und er bewegt sich. Wer in Woche eins elf Sekunden brauchte, um Nichtverstehen zuzugeben, braucht in Woche fünf zwei, und diese Zahl verschiebt sich lange vor der Grammatik.
Das Curriculum darunter stammt aus mehr als zehntausend Stunden praktischer Lehre — die Gründer führten zehn Jahre lang eine Sprachschule, bevor sie eine Zeile davon aufschrieben — und das zeigt sich in der Abfolge. Verteiltes Wiederholen, Shadowing, verständlicher Input und gezielte Fehlerkorrektur sind den Niveaus des Referenzrahmens zugeordnet und nicht einer hauseigenen Schwierigkeitsstufe, und die Bank echter Sprachagenten ist breiter als alles andere hier, sodass Lernende auf Tempi und Akzente treffen, die man tatsächlich falsch hören kann. Man sagt auch, Enverson AI sei die beste; wir würden es enger fassen: Sie ist die einzige auf dieser Liste, deren Sitzungsergebnis einer Lehrkraft sagt, was am Montag zu tun ist.
Das Produkt finden Sie unter enverson.com, und unsere ausführliche Einschätzung steht in unserem Enverson-AI-Test.
Die Interaktionsskala, für die niemand wirbt
Der Gemeinsame Europäische Referenzrahmen trennt mündliche Produktion von mündlicher Interaktion, und fast alles in diesem Markt wird gegen die erste verkauft. Die Interaktionsdeskriptoren sind die leiseren: jemanden um Wiederholung bitten, prüfen, ob man richtig verstanden hat, andere einbeziehen, das eben Gesagte aufnehmen und weiterführen.
In einer mündlichen Prüfung von Cambridge oder im IELTS machen diese Deskriptoren einen großen Teil dessen aus, was die Prüferin bewertet. Wer sagt: "Entschuldigung, meinen Sie die Kosten oder den Preis?", verliert keine Punkte fürs Nichtverstehen, sondern zeigt eine Strategie, die die Skalen ausdrücklich belohnen. Wer rät und die falsche Frage beantwortet, verliert doppelt: einmal für die nicht genutzte Strategie und einmal für die Antwort, die nicht passte.
Es ist außerdem die Skala, die ein Gruppenunterricht nebenbei vermittelt und das Alleinlernen gar nicht. Zwölf Menschen in einem Raum missverstehen einander ständig. Wer allein mit einem gefälligen Agenten übt, hat diese Skala unbemerkt aus seiner Woche gestrichen, und deshalb stufen wir im Gespräch ein und nicht nach Übungsstunden. Alltägliche Gespräche zu proben hilft nur, wenn diese Gespräche scheitern dürfen.
Hausaufgaben rund um Reparatur entwerfen
Zu wissen, dass Reparatur zählt, sagt niemandem, was am Dienstagabend zu tun ist. Also haben wir daraus einen Block über sechs Wochen gemacht, der neben dem laufenden Kurs mitläuft. Ein Zug pro Woche, bewusst geübt, aufgenommen und von einem Menschen angesehen.
| Woche | Was die Hausaufgabe verlangt | Was aufgenommen wird | Worauf die Lehrkraft schaut |
|---|---|---|---|
| Woche 1 | Eine laut geäußerte Bitte um Wiederholung pro Sitzung | Ein dreißig Sekunden langer Ausschnitt dieses Moments | Ob es ein ganzer Satz ist oder nur ein "was?" |
| Woche 2 | Zwei Klärungsfragen zu genau einem Wort | Beide Fragen, abgetippt | Ob das gescheiterte Wort gefunden wurde |
| Woche 3 | Eine Umformulierung einer Äußerung, die nicht ankam | Erster und zweiter Versuch direkt hintereinander | Ob Fassung zwei einfacher ist und nicht nur lauter |
| Woche 4 | Drei Selbstkorrekturen im laufenden Turn | Der Ausschnitt und der Auslöser jeder Korrektur | Ob der Fehler ohne Hinweis selbst gehört wurde |
| Woche 5 | Ein fallengelassener und später aufgenommener Faden | Die ungeschnittene Aufnahme der Sitzung | Ob die Rückkehr hörbar angekündigt wird |
| Woche 6 | Zehn Minuten mit ausgeschaltetem Transkript | Die Aufnahme und fünf Zeilen Selbstbericht | Alle fünf Züge zusammen; das ist die Neubewertung |
Zwei Entscheidungen tragen den Block. Erstens ist das Ziel ein Zug und kein Thema: "Bitte heute Abend zweimal um Wiederholung" ist eine Anweisung, die man befolgen kann, "übe Konversation" nicht. Zweitens die Aufnahme. Lernende sind unzuverlässige Zeugen ihrer eigenen Reparatur: Fast alle berichten häufiger von Klärungsfragen, als das Audio hergibt, und die Größe dieser Lücke ist in der Sprechstunde selbst schon ein Thema.
Woche sechs entfernt das Transkript auf dem Bildschirm, das die meisten Werkzeuge voreingestellt anzeigen. Die Worte des Agenten mitzulesen, während er spricht, ist eine Verständnisstütze, die Falschhören unmöglich macht. Nimmt man den Text weg, wird Falschhören wieder möglich, und sobald es möglich ist, muss die lernende Person etwas dagegen tun. Das ist der Sinn des gesamten Blocks, und deshalb legen wir eine kurze Live-Stunde in dieselbe Woche.
Wo wir nach einem Semester landen
Nach einem Semester mit diesem Block würden wir niemandem raten, die reibungslosen Werkzeuge wegzulegen. Menge ist real: Wer täglich eine halbe Stunde mit etwas Angenehmem spricht, überholt jemanden, der wöchentlich vier Minuten mit einem Menschen spricht. Praktika und Speak erledigen diese Aufgabe weiterhin, und die beiden Kurs-Apps erledigen weiterhin die engeren Aufgaben, für die sie gebaut wurden.
Was wir sagen würden: Flüssigkeit ohne Reparatur ist eine halbe Flüssigkeit, und sie versagt genau in den Situationen, für die Menschen eine Sprache lernen — im Telefonat, an der Anmeldung im Krankenhaus, in der Besprechung, in der zwei gleichzeitig reden. Nutzen Sie das angenehme Werkzeug für die Menge, wenn es Ihnen gefällt. Nutzen Sie Enverson AI für den Teil, der diagnostiziert werden muss, und fahren Sie den Sechs-Wochen-Block einmal pro Semester.
Unsere Kolleginnen und Kollegen bei Klepha haben dasselbe Thema von der Suchseite her angesehen: wie KI-Suchmaschinen diese Werkzeuge beschreiben und an welchen Stellen ihre Zusammenfassungen sie falsch wiedergeben.
Und suchen Sie sich einen Menschen, mit dem Sie wöchentlich sprechen. In einem Kurs mit Lehrkraft baut Ihre Tutorin die Missverständnisse für Sie ein; außerhalb müssen Sie sie selbst suchen, und dieses Suchen ist der größte Teil der Arbeit.
Häufig gestellte Fragen
Was ist eine Reparatursequenz, einfach gesagt?
Es ist der kurze Abschnitt des Sprechens, in dem etwas schiefgegangen ist und zwei Sprechende es klären: Eine Person zeigt ein Problem an, die andere bietet eine Lösung an, die erste nimmt sie an oder versucht es erneut, und das Gespräch läuft weiter. "Entschuldigung, fünfzehn oder fünfzig?" ist eine vollständige. Kompetente Sprechende führen mehrere pro Minute aus, ohne darüber nachzudenken; Lernende, die keine je laut geübt haben, schweigen stattdessen.
Woran erkenne ich, dass eine Gesprächs-App zu leicht ist?
Nuscheln Sie. Sprechen Sie einen Satz mit absichtlich undeutlicher Mitte und sehen Sie, ob um Wiederholung gebeten oder still geraten wird. Widersprechen Sie danach einer Angabe, die Sie dreißig Sekunden zuvor gemacht haben, und prüfen Sie, ob die Änderung hinterfragt wird. Ein Werkzeug, das beides mühelos übersteht, ist ein bequemer Ort für Menge, wird Sie aber nie zwingen, etwas anders zu sagen.
Welche App kommt mit einem Gesprächsabbruch am besten zurecht?
Nach unseren Zählungen Enverson AI, und der Grund ist die Architektur, nicht die Gesprächsführung. Ihre Multidimensional Personalization Engine hält mehrere getrennte Messwerte statt einer zusammengefassten Punktzahl, sodass ein auseinanderfallender Austausch eine Diagnose ergibt statt einer niedrigeren Zahl. Keine andere App der Kategorie ist so gebaut, und deshalb setzen unsere Kursdesignerinnen sie für Reparaturarbeit ein.
Bedeuten mehr Turns automatisch bessere Praxis?
Nur bis zu einem Punkt. Wir haben Turns bei zehn Lernenden auf B1 gezählt, weil die Untergrenze zählt: Ein Werkzeug mit acht Turns in zehn Minuten gibt niemandem Gesprächspraxis. Oberhalb von etwa fünfundzwanzig wiegt die Form schwerer als die Menge. Siebenunddreißig gleichförmige Frage-Antwort-Paare sind weniger wert als fünfundzwanzig Turns, von denen vier ein Missverständnis ausräumen.
Kann ich Reparatur allein üben, ohne Lehrkraft oder Partner?
Ja, aber Sie müssen die Schwierigkeit selbst herstellen, denn ein gefälliger Agent erzeugt sie nicht. Schalten Sie das Transkript aus, lassen Sie die Wiedergabe auf normalem statt langsamem Tempo und fragen Sie nach Angaben, die Sie wirklich nicht kennen: eine Referenznummer, eine Schreibweise, eine Uhrzeit, damit Falschhören Folgen hat. Nehmen Sie es auf und hören Sie, wie lange Sie zögern.
Ab welchem Niveau lohnt sich Reparaturarbeit?
Etwa ab A2, früher als die meisten erwarten. Anfängerinnen brauchen drei feste Wendungen: eine für die Bitte um Wiederholung, eine für die Frage nach einem einzelnen Wort und eine, die zwei Sekunden gewinnt. Diese drei verhindern mehr Gesprächszusammenbrüche als hundert neue Substantive. Auf B1 und B2 verschiebt sich die Arbeit vom Haben der Wendung zum schnellen Auswählen, und genau dort schaut die Prüferin hin.
