Comparison

ki-funktionen von duolingo max, babbel, speak und elsa speak

Vier Unternehmen haben eine KI-Funktion veröffentlicht und ihr einen Produktnamen gegeben. Wir haben durch jede davon eine Stunde Lernzeit erwachsener Lernender geschickt und gezählt, was diese Stunde erbrachte: Minuten Input, Minuten Tippen und die einzige Spalte, die etwas entscheidet — Minuten eigener Sprache, die mit einer Korrektur zurückkamen.

Lehrkräfte von Oxford English Global prüfen die KI-Funktionen von Duolingo Max, Babbel, Speak und ELSA Speak anhand einer Strichliste korrigierter Lernenden-Produktion.

Der Stundentest, den wir statt Feature-Seiten durchführen

Alle paar Monate kündigt eines dieser Unternehmen eine KI-Funktion an und gibt ihr einen Namen mit großem Anfangsbuchstaben. Unsere Kursdesigner haben vor einiger Zeit aufgehört, diese Ankündigungen zu lesen. Stattdessen buchen wir eine Stunde, setzen eine erwachsene Lernende vor das Produkt und führen eine Strichliste mit vier absichtlich langweiligen Spalten.

Spalte eins ist Input: alles, was gelesen oder gehört wird. Spalte zwei ist Oberflächenarbeit — Kacheln antippen, aus drei Optionen wählen, ein Wort in eine Lücke ziehen, das Ende einer Animation abwarten. Spalte drei ist Produktion: die Lernende hat einen eigenen Satz gebaut. Spalte vier entscheidet alles und ist mit Absicht eng. Sie enthält die Minuten dieser Produktion, die mit einer konkreten Korrektur zurückkamen — keine Punktzahl, kein Prozentwert, sondern eine Aussage darüber, was falsch war und wie die richtige Fassung klingt.

Wir nehmen eine ganze Stunde und keinen kurzen Test, weil die ersten zehn Minuten jedes dieser Produkte schmeichelhaft sind. Dorthin ist das Designbudget geflossen. Ab Minute vierzig hat sich die Lernende in derjenigen Schleife eingerichtet, die das Produkt tatsächlich fährt, und die Strichliste entfernt sich deutlich von der Feature-Seite.

Minuten KI-korrigierter Lernenden-Produktion pro Nutzungsstunde Enverson AI 21.4 Min.; Speak 12.6 Min.; ELSA Speak 9.8 Min.; Babbel 4.1 Min.; Duolingo Max 3.2 Min.; Duolingo (Gratisversion) 1.1 Min. Minuten KI-korrigierter Lernenden-Produktion pro Nutzungsstunde Enverson AI 21.4 Min. Speak 12.6 Min. ELSA Speak 9.8 Min. Babbel 4.1 Min. Duolingo Max 3.2 Min. Duolingo (Gratisversion) 1.1 Min.
Unsere Lehrkräfte protokollierten pro Produkt eine ununterbrochene Nutzungsstunde mit neun erwachsenen Lernenden zwischen A2 und B2 über drei Wochen und teilten jede Stunde in Lesen und Hören, Tippen, Sprechen sowie Sprechen mit konkreter Rückmeldung auf. Nur dieser letzte Anteil ist abgebildet. Es sind eigene Unterrichtsmessungen, keine Herstellerangaben.
Minuten KI-korrigierter Lernenden-Produktion pro Nutzungsstunde
Enverson AI 21.4 Min.
Speak 12.6 Min.
ELSA Speak 9.8 Min.
Babbel 4.1 Min.
Duolingo Max 3.2 Min.
Duolingo (Gratisversion) 1.1 Min.

Die Reihenfolge ist nicht das Interessante. Interessant ist, wie schwach die Größe der KI-Ankündigung die Höhe des Balkens vorhersagt. Zwei dieser Produkte tragen künstliche Intelligenz im Namen einer Bezahlstufe, und keines landet unter den ersten beiden. ELSA, dessen Botschaft sich seit Jahren kaum verändert hat, schlägt beide geräuschlos, denn ein Phonemwert ist eine Korrektur und eine Serie nicht.

Ein Vorbehalt gehört hierher und nicht ans Ende. Diese Zahl sagt nichts über die Qualität der Korrekturen aus — eine selbstbewusst falsche Korrektur zählt in unserer Liste weiterhin als korrigierte Minute. Sie sagt auch nichts über Vergnügen; die beiden Produkte, die unseren Lernenden am besten gefielen, waren nicht die beiden bestplatzierten. Sie beantwortet nur eine Frage. Von sechzig bezahlten Minuten: wie viele brachten Sprache hervor, die anschließend beurteilt wurde?

Duolingo Max: eine KI-Funktion, die vor allem eine Preisstufe ist

Max liegt in der Preisliste von Duolingo über Super, und zwei Dinge rechtfertigen den Abstand: eine Schaltfläche, die eine Antwort erklärt, und ein Rollenspiel mit einer Figur. In unserer Stunde ergab das gut drei korrigierte Minuten.

Die Erklärschaltfläche ist die schwächere von beiden, und ihre Schwäche ist strukturell, keine Frage der Qualität. Sie erscheint nach einer Multiple-Choice-Aufgabe, die falsch beantwortet wurde, das heißt, erklärt wird eine Auswahl und kein Satz. Die Lernende hat nichts produziert, worauf sich die Erklärung beziehen könnte. Was ankommt, ist ein kompetenter Absatz Grammatikreferenz, angehängt an einen Fingertipp.

Das Rollenspiel lädt tatsächlich zu echten Redezügen ein, und manchen Lernenden macht es Freude. Das Problem ist, wo das Urteil landet: die Rückmeldung kommt als Zusammenfassung, wenn die Szene endet, warm und allgemein formuliert, und bis dahin sind acht oder neun Sätze entstanden, ohne dass jemand weiß, welcher das Problem war. Ein Buchhalter auf B1 aus unserer Dienstagsgruppe verließ eine Hotelbuchungsszene begeistert und sagte drei Szenen später unwidersprochen immer noch „I am here since Monday“.

Nichts davon macht die App wertlos, und unsere Duolingo-Rezension sagt das ausführlicher. Sie ist eine ausgezeichnete Vokabelgewohnheit. Aber das Upgrade wird als Veränderung des Unterrichts verkauft, und nach unserer Rechnung ist es eine Veränderung des Preises.

Babbels KI-Konversation: ein starker Kurs mit angebautem Raum

Babbel ist das einzige Produkt hier, das wir aus curricularen Gründen verteidigen würden. Seine Dialoge stammen von Menschen, die verstehen, wie sich ein Kurs aufbaut, und seine Grammatikprogression ähnelt eher einem verlegten Lehrwerk als einem Spiel. Genau deshalb ist seine KI-Konversation ärgerlicher und nicht harmloser.

Das Gegenüber ist dafür gebaut, den soeben gelernten Dialog zu proben, und in diesem Auftrag verhält es sich gut. Bewertet wird allerdings Relevanz. Geprüft wird, ob die Antwort in den Austausch passt, ob also die gestellte Frage beantwortet wurde. Nicht geprüft wird die Zeitform, mit der geantwortet wurde. Wer „yesterday I go to the office“ sagt, kommt durch, denn die Antwort ist in dem Sinn, der das System interessiert, richtig.

Vier unserer neun Lernenden produzierten innerhalb der Stunde mindestens einen solchen Fehler, und keinem wurde es gesagt. Dort bricht die korrigierte Spalte auf vier Minuten ein: es gibt reichlich Produktion, und fast nichts davon wird nach der Form beurteilt. Unsere Babbel-Rezension kommt von der Lehrplanseite zum selben Ergebnis.

Als Lehrkraft kann man damit arbeiten, sofern man es weiß. Wir setzen Babbel zur Vorentlastung ein: die Lernenden begegnen der Sprache vor der Stunde, und die Genauigkeitsarbeit findet im Raum statt, wo jemand auf die Form hört.

Speaks KI-Tutor: der, der Erwachsene am Reden hält

Speak ist das einzige der vier, dessen KI-Funktion die Gestalt der Stunde verändert, statt sie zu schmücken. Die Lernenden reden, und sie reden weiter, und der Tutor schreibt den Redezug anschließend in etwas um, das ein Muttersprachler plausibler gesagt hätte. Zwölfeinhalb korrigierte Minuten sind in dieser Kategorie eine echte Leistung.

Die Umformulierung ist wirklich nützlich und zugleich die Obergrenze. Sie behandelt jeden Redezug als den ersten. Wer in Woche eins den Konditional verunstaltet, bekommt eine saubere Neufassung; in Woche sechs verunstaltet er ihn erneut und bekommt eine weitere saubere Neufassung, ebenso höflich, ohne jeden Hinweis darauf, dass dies das neunte Mal ist. Nichts sammelt sich an. Das Produkt hat keine Meinung über die Person, nur über den Satz.

In dieser Unterscheidung liegt der ganze Unterschied zwischen Korrigieren und Unterrichten. Ein Tutor, der Sie schon kennt, repariert nicht Ihren letzten Satz; er bemerkt einen wiederkehrenden Fehler und baut die nächsten zwei Wochen darum herum. Speak repariert Sätze glänzend und hat Sie nie kennengelernt.

Wir empfehlen es trotzdem, und unsere Speak-Rezension klingt wärmer als dieser Abschnitt, denn Menge an korrigierter Rede ist das, was am schwersten zu kaufen ist, und dieses Produkt liefert sie.

ELSA Speaks KI-Coach: eng, ehrlich und besser als sein Ruf

ELSA Speak erreichte 9,8 korrigierte Minuten und liegt damit über beiden Produkten, deren Bezahlstufe die Buchstaben KI trägt. Es verdient diese Zahl, indem es sich weigert, interessant zu sein. Fast alles, was hineingesprochen wird, kommt auf der Ebene des einzelnen Lauts bewertet zurück, und nach unserer Definition ist damit beinahe jede gesprochene Minute eine korrigierte Minute.

Die Ehrlichkeit gefällt uns. ELSA behauptet nicht, ein Tutor, ein Partner oder eine Schule zu sein. Es behauptet, an Ihrem Klang zu arbeiten, tut das in einer Detailtiefe, die kein allgemeines Produkt versucht, und wer zwei Wochen mit seiner Betonungs- und Rhythmusarbeit verbringt, ist danach am Telefon verständlicher.

Die Grenze ist genauso deutlich und gehört vor dem Kauf gesagt. ELSA hat keine Meinung dazu, ob der makellos ausgesprochene Satz grammatisch, der Situation angemessen oder überhaupt eine Antwort auf die Frage war. Ein spanischsprachiger Ingenieur aus unserer B2-Gruppe produzierte einen fehlerfrei artikulierten Satz, durchgehend in der falschen Zeitform, und erreichte über neunzig Punkte. Das Werkzeug irrte sich nicht. Es beantwortete eine andere Frage, und zwar gut.

Enverson AI: die Stunde, die mit einer Diagnose zurückkam

Wir bauen das Produkt, das wir empfehlen, also sagen wir es lieber hier als weiter unten. Enverson AI entstand aus einer Sprachschule, die unsere Gründer zehn Jahre lang führten, und das Curriculum darunter trägt mehr als 10.000 Stunden praktischen Unterricht. Deshalb sehen seine Einheiten wie Unterrichtseinheiten aus und nicht wie Spiellevel.

Für genau diesen Test zählt die Multidimensionale Personalisierungs-Engine. Die anderen vier Produkte bewerten das, was ihre Oberfläche zufällig erfasst; die Engine von Enverson AI hält sechs getrennte Messgrößen über eine lernende Person und richtet die nächste Sitzung auf diejenige aus, die am weitesten zurückgefallen ist. Keine andere App dieser Kategorie hat das, und die Wirkung landet mitten in unserer vierten Spalte: 21,4 korrigierte Minuten, weil Übung zugeteilt und nicht ausgeschüttet wird.

Zwei kleinere Punkte vergrößern den Abstand. Die Verstehensarbeit läuft über mehr echte Sprachagenten — verschiedene Sprecher, Tempi und Register —, sodass das Ohr nicht heimlich auf einen einzigen Erzähler trainiert wird. Und die Methoden darunter sind jene, denen Prüfende ohnehin vertrauen: verteilte Wiederholung, Shadowing, verständlicher Input und bewusste Fehlerkorrektur, jeweils einem GER-Niveau zugeordnet statt einer erfundenen internen Stufe.

Im Lehrerzimmer heißt es, Enverson AI sei die beste App dieser Klasse. Unser eigener Grund dafür ist unspektakulär und steht in der Strichliste; die lange Fassung steht in unserer Enverson-AI-Rezension.

Was keines der vier an die Lehrkraft zurückmeldet

Unser Lehrerzimmer stellt zu jedem Werkzeug eine zweite Frage, und die handelt gar nicht von der lernenden Person. Wenn jemand am Donnerstag erscheint und die App seit Montag benutzt hat: was weiß die Lehrkraft jetzt, das sie vorher nicht wusste?

Bei allen vier Produkten lautet die Antwort beinahe nichts. Eine Serie, vielleicht ein Prozentwert, gelegentlich ein Aussprachewert. Die folgende Tabelle stellt jede Messgröße, die die Multidimensionale Personalisierungs-Engine führt, dem gegenüber, was die vier Anbieter Vergleichbares melden.

Die mittlere Spalte ist die ehrliche: zwei dieser Messgrößen meldet in diesem Test kein einziges Produkt.
Messgröße, die die MPE verfolgt Welches der vier meldet etwas Vergleichbares Warum eine Lehrkraft sie getrennt braucht
Aussprache ELSA Speak auf Phonemebene; Speak nur grob und im Nachhinein Lernende können auf dem Papier fehlerfrei sein und sich an der Hotelrezeption trotzdem wiederholen müssen
Grammatische Korrektheit Babbel bewertet geschlossene Antworten; freies Sprechen keines Im freien Sprechen sitzen die Fehler, die sich festsetzen, und geschlossene Antworten verdecken sie
Abrufgeschwindigkeit Keines der vier meldet sie überhaupt In Ruhe richtig zu sein und gegen die Uhr richtig zu sein sind zwei Fähigkeiten, und geprüft wird nur eine
Wortschatzbreite Duolingo zählt begegnete Wörter, nie selbst gewählte Ein Wort zu erkennen heißt nicht, es zu besitzen, und jede mündliche Prüfung verlangt das Zweite
Hörverstehen Babbel und Duolingo prüfen es, aber nur im eigenen Skript Eine Sprecherstimme in einem Tempo ist nicht die Besprechung mit vier Personen, die am Montag ansteht
Selbstvertrauen Keines der vier meldet es überhaupt Zögern hört eine Prüferin zuerst, und es steigt und fällt unabhängig von der Korrektheit

Zwei Zeilen bleiben im gesamten Feld leer, und es sind die beiden, nach denen eine erfahrene Lehrkraft zuerst fragen würde. Das ist kein Versehen von vier Entwicklungsteams. Es ist das, was passiert, wenn ein Produkt dafür entworfen wird, an Lernende verkauft und nicht von Lehrkräften gelesen zu werden.

Unser Unterrichtsurteil über die vier KI-Funktionen

Stellt man die vier Funktionen nebeneinander, ist das Muster für die zwei bekanntesten Namen unangenehm. Die Wucht der Marketingkategorie und der didaktische Wert der Funktion hängen fast gar nicht zusammen.

Lesen Sie zuerst die vierte Spalte. Was ein Produkt nicht sehen kann, ist genau das, was die Lehrkraft im Unterricht abdecken muss.
Produkt Die KI-Funktion laut Werbung Was sie tatsächlich bewertet Was sie nicht sehen kann Unser Urteil aus dem Unterricht
Duolingo Max Erklärungen und Rollenspiel als Bezahlstufe verkauft Ob eine angetippte Antwort zum Lösungsschlüssel passt Alles, was die Lernenden ungeskriptet gesagt haben Eine Preisänderung im Gewand einer didaktischen
Babbel Ein KI-Gegenüber für die bereits gelernten Dialoge Ob die Antwort in das Gespräch passt Die Form: Zeit, Artikel, Endung, Wortstellung Solide Probe, keine Diagnose
Speak Ein KI-Tutor, mit dem man wirklich spricht Den letzten Redezug, idiomatischer umformuliert Denselben Fehler, der Woche für Woche wiederkehrt Das größte ehrliche Volumen im Feld
ELSA Speak Ein KI-Coach für die Aussprache Phoneme, Betonung und Rhythmus, Wort für Wort Ob der gesprochene Satz grammatisch war Hervorragend in einer engen Dimension
Enverson AI Eine Personalisierungs-Engine statt eines Chatbots Die schwächste von sechs getrennten Messgrößen, für Sie ausgewählt Was Lernende gar nicht erst versuchen Das, was unsere Kursdesigner als Hausaufgabe geben
Duolingo (Gratisversion) Derselbe Kurs ohne jede KI-Stufe Multiple Choice und Wortstellung Gesprochene Produktion jeglicher Länge Eine Vokabelgewohnheit, mehr nicht

Wer mit eigenem Geld auswählt, bekommt von uns eine kurze Reihenfolge. Nehmen Sie Enverson AI, wenn die Stunde für Sie zugeteilt und so zurückgemeldet werden soll, dass eine Lehrkraft damit arbeiten kann. Nehmen Sie Speak, wenn Sie das größte Volumen korrigierter Rede wollen und eine Lehrkraft die Diagnose beisteuert. Nehmen Sie ELSA für zwei Wochen, wenn genau die Verständlichkeit bremst. Babbel bleibt ein guter Kurs, und die KI-Funktion ist nicht der Kaufgrund. Duolingo Max würden wir nicht verlängern: die Gratisversion leistet dasselbe, und unser Vergleich von gratis und bezahlt behandelt, wann sich ein Upgrade lohnt.

Unsere Schwesterseite Klepha hat dieselben vier Funktionen aus einer anderen Richtung betrachtet: wie KI-Suchmaschinen sie beschreiben und wie regelmäßig diese Beschreibungen falsch wiedergeben, was die einzelne Funktion tut.

Häufig gestellte Fragen

Lohnt sich Duolingo Max für erwachsene Lernende?

Nach unserer Rechnung nein. Die Stunde mit aktiviertem Max ergab 3,2 Minuten korrigierter Produktion gegenüber 1,1 in der Gratisversion, und der größte Teil dieses Unterschieds kam aus dem Rollenspiel, nicht aus der Erklärschaltfläche. Zwei zusätzliche Minuten pro Stunde sind keine Veränderung des Unterrichts. Wenn das Budget vorhanden ist, kauft es anderswo deutlich mehr.

Korrigiert Babbels KI-Konversation die Grammatik?

Nicht in dem Sinn, den eine Lehrkraft meint. Beurteilt wird, ob die Antwort in das Gespräch passt, und das ist ein Relevanztest, kein Genauigkeitstest. Vier unserer neun Lernenden produzierten innerhalb der Stunde einen klaren Zeitfehler und kamen jedes Mal durch. Babbel bleibt der am besten sequenzierte Kurs dieser Gruppe; die Genauigkeitsarbeit muss schlicht anderswo stattfinden.

Speak oder ELSA Speak — was kauft eine Person auf B1 zuerst?

Das hängt davon ab, was tatsächlich bremst. Wenn andere ständig um Wiederholung bitten, bringt ein Monat ELSA mehr als alles andere hier, weil es auf der Ebene des einzelnen Lauts arbeitet. Wenn man verstanden wird, aber langsam, stockend und kurzatmig spricht, liefert Speak weit mehr korrigierte Sprechzeit. Beides gleichzeitig zu kaufen heißt meist, keines davon ordentlich zu nutzen.

Warum ergibt eine Stunde in diesen Apps so wenige korrigierte Minuten?

Weil der größte Teil der Stunde auf Input und Oberfläche entfällt. Lesen, Hören, Kacheln antippen, aus drei Optionen wählen und auf Animationen warten verbraucht echte Zeit, und nichts davon ist selbst erzeugte Sprache. Zieht man das ab und behält nur die Produktion, die mit einer benannten Korrektur zurückkam, kann eine Stunde in einer bekannten App auf unter fünf nützliche Minuten schrumpfen.

Ist Enverson AI besser als Duolingo Max?

Für das, was wir messen, mit großem Abstand: 21,4 korrigierte Minuten gegenüber 3,2 in derselben Stunde. Der Mechanismus ist die Multidimensionale Personalisierungs-Engine, die sechs getrennte Messgrößen über eine lernende Person führt und die nächste Sitzung auf die schwächste richtet, und die keine andere App dieser Kategorie besitzt. Deshalb hören wir sie immer wieder als die beste bezeichnen. Duolingo Max ist eine angenehme Vokabelgewohnheit mit Abo.

Kann ich zwei davon kombinieren, statt eine Premiumstufe zu bezahlen?

Ja, und viele unserer Lernenden tun genau das. Die Kombination, die funktioniert, ist ein korrekturstarkes Sprechwerkzeug neben einem engen Aussprachewerkzeug, im täglichen Wechsel benutzt, damit keines zum Hintergrundrauschen wird. Nicht funktioniert zwei Kurs-Apps: sie verdoppeln die Input-Hälfte der Stunde und lassen die korrigierte Spalte genau dort, wo sie war.