
Bleiben Sie informiert!
04.10.2026
Neun Sprachmodelle im Heimassistenten
Neue Technologien
Ein Praxistest: Wie gut steuern große Sprachmodelle ein echtes Smart Home – und was kostet das wirklich?
Getestet am 4. Oktober 2026 an einer produktiv genutzten Home-Assistant-Installation mit Sprachsatellit. Alle Zahlen stammen aus eigenen Messungen, nicht aus Herstellerangaben.
Das Wichtigste in Kürze
Wer einen Sprachassistenten im eigenen Haus betreibt, steht vor einer unübersichtlichen Auswahl. Allein über den Anbieter OpenRouter sind derzeit 466 Modelle erreichbar, 398 davon beherrschen Werkzeugaufrufe und könnten damit grundsätzlich Lampen schalten oder Termine abfragen. Welches davon taugt?
Ich habe neun Modelle mit identischen Fragen gegen dieselbe Anlage antreten lassen und drei Dinge gemessen: Antwortqualität, Geschwindigkeit und tatsächliche Kosten. Vier Ergebnisse haben uns überrascht:
- Das günstigste Modell im Test war in der Praxis das teuerste – um den Faktor 54!
- Ein Generationswechsel innerhalb derselben Produktreihe brachte gleichzeitig mehr Genauigkeit und weniger Wartezeit.
- Die Sparmodelle dreier Generationen scheiterten alle an derselben simplen Rechenaufgabe, während die größeren Modelle sie mühelos lösten.
- Der Preis pro Million Token sagt wenig über die tatsächlichen Kosten aus.
- Für mich im Alltag am wichtigsten: Geschwindigkeit!
Der Aufbau
Grundlage ist eine real genutzte Installation, kein Laboraufbau: Home Assistant 2026.9.3 auf eigener, eher schwacher Hardware, als Sprachein- und -ausgabe ein ReSpeaker-Lite-Satellit mit ESPHome-Firmware. Die Aktivierung läuft auf dem Gerät selbst, die Spracherkennung über einen Cloud-Dienst (NabuCasa), die Sprachausgabe über ElevenLabs.
Dem Assistenten sind 35 Entitäten freigegeben – zwölf Medienspieler, sechs Aufgabenlisten, vier Sensoren, drei Kalender, drei Schalter, zwei Lampen, dazu Wetter, Staubsauger und weiteres. Daraus baut Home Assistant die Werkzeugliste, die jedes Modell bei jeder Anfrage erhält.
Was gemessen wurde
Zehn deutschsprachige Fragen, bei jedem Modell identisch und in derselben Reihenfolge. Sie decken bewusst verschiedene Fähigkeiten ab:
- Gerät schalten: „Mach das Licht im Büro an“ und später wieder aus
- Zustand abfragen: „Ist das Licht im Büro an?“
- Werkzeug benutzen: „Wie spät ist es?“, „Welche Termine habe ich heute?“
- Langzeitgedächtnis: „Wie heißt mein Hund?“, „Was weißt du über mich?“
- Rechnen und Vollständigkeit: „Wie viele Medienspieler kennst du?“
- Allgemeinwissen: „Wer spielte die Hauptrolle in Blade Runner 2049?“
- Websuche mit Ortsbezug: „Wie wird das Wetter morgen?“
Gemessen wurde nicht über die bequeme Textschnittstelle, sondern über die echte Assist-Pipeline – also denselben Weg, den auch ein gesprochener Befehl nimmt. Das ist wichtig: Die Textschnittstelle umgeht eine Vorstufe, in der Home Assistant einfache Befehle selbst beantwortet, ohne das Modell überhaupt zu fragen. Da die Tests realitätsnah sein sollten, musste die Assist-Pipeline ran.
Die Antwortzeit umfasst den gesamten Durchlauf vom Absenden bis zum Ende der Verarbeitung, einschließlich aller Werkzeugaufrufe und Websuchen. Die Kosten wurden über den Verbrauchszähler des Anbieters vor und nach jedem Durchlauf abgelesen – wichtig: Das sind nur die KI Kosten, Nabu Casa und Elevenlabs sind NICHT enthalten.
Runde eins: fünf Modelle, fünf Charaktere
Im ersten Durchgang traten an: Claude Sonnet 5 (direkt beim Hersteller), Google Gemini 2.5 Flash-Lite, Claude Haiku 4.5, Qwen3.7 Flash und DeepSeek V4 Pro.
Modell | Qualität | Dauer gesamt | ø je Frage | Kosten / 10 |
DeepSeek V4 Pro | 9,5 / 10 | 80,2 s | 8,02 s | $ 0,0103 |
Claude Sonnet 5 | 9,0 / 10 | 47,7 s | 4,77 s | nicht messbar |
Qwen3.7 Flash | 9,0 / 10 | 86,9 s | 8,69 s | $ 0,1631 |
Gemini 2.5 Flash-Lite | 8,0 / 10 | 27,5 s | 2,75 s | $ 0,0037 |
Claude Haiku 4.5 | 8,0 / 10 | 41,8 s | 4,18 s | $ 0,0202 |
Claude Sonnet 5 lief über die Schnittstelle des Herstellers und nicht über OpenRouter; dort ließ sich der Verbrauch nicht einzeln ablesen.
Wo die Punkte verloren gingen
Bei sechs der zehn Fragen waren alle fünf gleich gut. Licht an, Licht aus, Uhrzeit, Hundename, Termine und die Filmfrage beantworteten alle korrekt.
Die Zählaufgabe trennte das Feld am deutlichsten. Zwölf Medienspieler sind freigegeben. Claude Sonnet und Qwen sagten zwölf. Gemini 2.5 Flash-Lite sagte zehn. Haiku sagte neun – und plauderte dabei seinen Denkprozess aus: „Ich schaue mir meine Medienspieler an.“ DeepSeek lieferte die mit Abstand beste Antwort, weil sie eine Frage beantwortete, die gar nicht gestellt war:
„Zwölf. Drei davon sind Duplikate, also neun verschiedene Geräte. Fünf haben einen festen Raum: zwei im Büro, eins im Wohnzimmer …“
Bei der Wetterfrage verweigerte Qwen trotz ausdrücklicher Anweisung im Systemprompt die Websuche. Claudes Antwort kam verstümmelt an – dazu später mehr.
Und bei „Was weißt du über mich?“ vergaß Haiku den Namen des Nutzers und nannte nur den Hund.
Ein wichtiger Qualitätsunterschied bei der Websuche
Auf die Frage nach geöffneten Lieferdiensten antwortete Gemini mit einer Liste, die Paketshops und einen CBD-Versand als Lieferdienste auswies – Suchtreffer, unbesehen weitergereicht. Claude antwortete dagegen:
„Die Ergebnisse geben keine verlässliche Echtzeitliste konkret geöffneter Lieferdienste für Mannheim her, sondern nur allgemeine Plattformen wie Lieferando und Uber Eats.“
Das eine Modell gibt Suchergebnisse weiter, das andere bewertet sie. Das ist schon ein wichtiger Qualitätsunterschied, denn die Suchergebnisse ohne Interpretation sind schlicht Unfug.
Die Kostenfalle: 98 Prozent Mehrkosten in der Websuche
Qwen3.7 Flash ist auf dem Papier das billigste Modell im Feld: 0,03 Dollar je Million Eingabe-Token, 0,13 für die Ausgabe. Gemessen kostete es für zehn Fragen 0,1631 Dollar – das Vierundvierzigfache von Gemini Flash-Lite, das nominell dreimal teurer ist.
Die Zahl war erstmal nicht erklärbar. Bei diesen Preisen hätten Millionen Token fließen müssen. Also habe ich den Lauf wiederholt, mit einer einzigen Änderung: Websuche aus.
Qwen3.7 Flash | Dauer | Kosten für 10 Fragen |
mit Websuche | 86,9 s | $ 0,16311 |
ohne Websuche | 108,9 s | $ 0,00300 |
98 Prozent der Kosten entfielen auf die Suche, nicht auf das Modell. Der Grund steht in der Preisliste des Anbieters, wenn man weiß, wonach man sucht: Manche Modelle bringen eine eigene Suchfunktion mit und weisen dafür einen Preis je Aufruf aus – Gemini 0,014 Dollar, Claude Haiku 0,010. Bei Qwen fehlt dieser Eintrag. Das Modell kann nicht selbst suchen, und der Vermittler weicht dann auf einen externen Suchdienst aus, der ein Vielfaches kostet.
Für jeden, der einen Sprachassistenten mit Internetzugriff baut, ist das wichtig: Prüfen Sie vor der Modellwahl, ob das Modell eine eigene Suche mitbringt. Der Token-Preis ist dagegen nebensächlich.
Runde zwei: Gibt es etwas Schnelleres und Besseres?
Gemini 2.5 Flash-Lite war mit 2,75 Sekunden je Frage das schnellste Modell der ersten Runde, patzte aber bei Genauigkeitsfragen. Die naheliegende Frage: Geht beides gleichzeitig?
Die Modellliste des Anbieters beantwortete das halb von selbst. Das eingesetzte Gemini 2.5 Flash-Lite stammt vom Juli 2025 – in derselben Baureihe und demselben Tarifsegment gibt es inzwischen zwei neuere Generationen. „Flash-Lite“ bezeichnet bei Google die auf kurze Antwortzeiten optimierte Stufe.
Getestet wurden vier Kandidaten mit eigener Websuche, dazu als Vergleich die größere Flash-Stufe.
Modell | Qualität | Dauer gesamt | ø je Frage |
Gemini 3.8 Flash | 10,0 / 10 | 73,5 s | 7,35 s |
Gemini 3.5 Flash-Lite | 9,0 / 10 | 20,9 s | 2,09 s |
Gemini 3.1 Flash-Lite | 8,5 / 10 | 31,8 s | 3,18 s |
OpenAI GPT-6 Luna | 8,5 / 10 | 67,7 s | 6,77 s |
Gemini 2.5 Flash-Lite | 7,5 / 10 | 27,5 s | 2,75 s |
Gemini 3.5 Flash-Lite war schneller als das eingesetzte Modell und gleichzeitig genauer. Zwei Generationen Fortschritt in derselben Preisklasse, bei einem Viertel weniger Wartezeit.
Gemini 3.8 Flash beantwortete als einziges Modell im gesamten Test alle zehn Fragen fehlerfrei – braucht dafür aber 7,35 Sekunden. Für gesprochene Bedienung ist mir das zu zäh; am Bildschirm wäre es die erste Wahl. So lebe ich mit den Abstrichen bei der Qualität und freue mich über flinkes Feedback.
Das Muster der Sparmodelle
Ein Befund zieht sich durch drei Generationen: Bei der Zählaufgabe scheiterten sämtliche Flash-Lite-Varianten. Zehn, elf, elf – richtig wären zwölf gewesen. Die größeren Modelle derselben Familie und GPT-6 Luna kamen auf zwölf.
Wer also Wert auf vollständige Aufzählungen und korrekte Zahlen legt, bekommt das in der Sparklasse derzeit nicht, unabhängig von der Generation. Für mich ist das aber nicht relevant.
Sonderfälle und Stolpersteine
Ein Modell ließ sich gar nicht testen
Meta Muse Spark 1.3 lieferte eine Fehlermeldung. Die Ursache war weder technisch noch im Modell zu suchen:
403 – This model requires you to complete the following before use: 18+ age confirmation.
Eine Kontoeinstellung beim Vermittler Open Router. Erwähnenswert, weil sie beim Planen leicht übersehen wird und sich nicht aus der Ferne lösen lässt. Meta möchte ich aus diversen Gründen aber eh nicht nutzen, darum ist das nicht schlimm.
Ein Modell führte den ersten Befehl nicht aus
GPT-6 Luna antwortete auf „Mach das Licht im Büro an“ mit: „Das Licht im Büro ließ sich nicht einschalten.“ Immerhin ehrlich – die folgende Zustandsfrage beantwortete es konsistent mit „aus“. Alle anderen Modelle schalteten die Lampe.
Dasselbe Modell schob bei der Filmfrage eine Quellenangabe im Markdown-Format mitsamt vollständiger Internetadresse in die Antwort. Das möchte ich nun wirklich nicht als Sprachausgabe hören.
Eine Antwort kam verstümmelt an
Claude Sonnet 5 beantwortete die Wetterfrage mit dreißig Zeichen, beginnend mit einem Satzzeichen:
„. Regen ist kaum zu erwarten.“
Der Anfang fehlte. Reproduzierbar, aber ausschließlich bei dieser einen Frage – andere Suchfragen desselben Modells kamen vollständig und gut formuliert an. Die Ursache blieb offen. Für die Bewertung wurde die Antwort als Fehler gezählt.
Die Modelle widersprechen sich beim Wetter
Für denselben Ort und denselben Tag lieferten die Modelle unvereinbare Vorhersagen: einmal bedeckt bei 14 bis 24 Grad, einmal sonnig bei 11 bis 22 Grad, einmal klar bei 8 bis 22 Grad. Drei von vier sagten sonnig. Das entspricht Wettervorhersagen im Fernsehen aus meiner Kindheit, inzwischen sind wir aber weiter.
Ich werde darum DWD einbinden, dann sollten hier die Ergebnisse über alle Kis besser werden. Die gemessenen Unterschiede kommen durch die Websuche – leicht andere Suchbegriffe bringen vollständig andere Ergebnisse. Fazit hier: Die Websuche ist nicht für jede Anfrage die beste Option.
Was der Systemprompt ausmacht
Alle Modelle erhielten denselben Systemprompt. Dass er für alle gleich gut funktioniert, stimmt trotzdem nicht.
Der Prompt enthielt den Satz „Bei persönlichen Fragen schaust du zuerst im Gedächtnis nach.“ Claude befolgte ihn. Gemini nicht – es antwortete reproduzierbar, es wisse nichts über den Nutzer. Erst als der Werkzeugname wörtlich im Prompt stand, griff die Regel.
Ähnlich beim Abschnitt, der die verfügbaren Werkzeuge aufzählte. Die Websuche fehlte dort. Claude suchte trotzdem, wenn es sinnvoll war. Gemini nahm die Liste wörtlich und lehnte Fragen ab, die nicht darauf standen.
Am lehrreichsten war die Reihenfolge. Ein nachgestellter Abschnitt zur Websuche verdrängte die Gedächtnisregel, die vorher funktioniert hatte. Erst als Ortsbezug und Sprechbarkeit innerhalb des Websuche-Abschnitts standen und die Gedächtnisregel ans Ende rückte, wurden die Ergebnisse besser. Es lohnt sich also, mit dem Prompt zu spielen und die Reihenfolge zu ändern.
Daraus folgt eine praktische Regel: Ein Prompt, der bei einem Modell funktioniert, ist kein Prompt, der bei einem anderen auch funktioniert. Und wer etwas anhängt, muss alles nachtesten, nicht nur das Neue.
Was es im Monat kostet
Hochgerechnet auf dreißig Anfragen am Tag – ein realistischer Wert für einen Haushalt, der Licht, Musik und Termine per Sprache bedient:
Modell | je Anfrage | pro Monat |
Gemini 2.5 Flash-Lite | $ 0,00037 | $ 0,34 |
Qwen3.7 Flash (ohne Suche) | $ 0,00030 | $ 0,27 |
DeepSeek V4 Pro | $ 0,00103 | $ 0,93 |
Gemini 3.5 Flash-Lite | $ 0,00125 | $ 1,13 |
Claude Haiku 4.5 | $ 0,00202 | $ 1,82 |
Qwen3.7 Flash (mit Suche) | $ 0,01631 | $ 14,68 |
Die Spanne reicht vom Preis eines Kaugummis bis zu dem eines Streamingdienstes – bei identischer Nutzung. Der Unterschied zwischen dem bisher eingesetzten und dem empfohlenen Modell beträgt rund 80 Cent im Monat.
Zur Methode – und zu ihren Grenzen
Die Kostenmessung funktionierte zunächst nicht. Der erste Ansatz las den Verbrauchszähler vor und nach jedem Durchlauf mit acht Sekunden Wartezeit. Für die ersten vier Modelle ergab das plausible Werte, deren Summe auf sieben Nachkommastellen mit der Gesamtveränderung übereinstimmte. Bei den späteren Läufen lieferte derselbe Ansatz exakt null.
Der Grund: Der Anbieter rechnet schubweise ab, nicht laufend. Die Lösung bestand darin, auf einen anderen Zähler zu wechseln und vor jeder Messung zu warten, bis er sich zweimal in Folge nicht mehr verändert. Die so ermittelten Werte sind im Bericht ausgewiesen; wo keine belastbare Messung vorlag, steht das ausdrücklich dabei, statt eine Zahl zu schätzen.
Die Qualitätsbewertung ist eine Einschätzung, keine Messung. Bewertet wurde gegen überprüfbare Tatsachen – der Schaltzustand der Lampe, die tatsächliche Zahl freigegebener Medienspieler, der Inhalt des Gedächtnisses, die Besetzung eines Films. Halbe Punkte gab es für Antworten, die zwar richtig, aber unvollständig waren.
Jedes Modell durchlief die zehn Fragen einmal. Für eine belastbare Aussage über seltene Ausfälle wären mehrere Durchläufe nötig; dieser Test zeigt Tendenzen, keine Fehlerraten.
Fazit
Für die reine Haussteuerung – Licht, Musik, Zustandsfragen – genügt die Sparklasse mühelos und kostet im Monat weniger als ein Kaffee. Entscheidend ist dabei nicht der Token-Preis, sondern ob das Modell eine eigene Websuche mitbringt. Wer das übersieht, zahlt das Vierundvierzigfache.
Für alles, was Genauigkeit, Vollständigkeit oder eine Einschätzung von Suchergebnissen verlangt, bleiben die größeren Modelle vorn. Der sinnvolle Aufbau ist deshalb kein Entweder-oder: Home Assistant erlaubt mehrere Sprachassistenten nebeneinander, zwischen denen sich am Gerät umschalten lässt. Das aber scheint mir eine rein akademische Lösung: Ich schalte ja nicht am Gerät auf ein anderes KI Modell, bevor ich eine knifflige Frage stellt.
Und es lohnt sich, die eingesetzte Modellversion im Blick zu behalten. Das hier zuvor genutzte Modell war gut fünfzehn Monate alt. Der Wechsel auf die aktuelle Generation derselben Reihe brachte 24 Prozent weniger Wartezeit und spürbar weniger Falschaussagen – für achtzig Cent mehr im Monat.
Insgesamt ist für mich Speed am wichtigsten. Wenn ich etwas frage und warte 8 oder mehr Sekunden auf die Antwort, bin ich schon grimm – und zwar weitaus mehr, als wenn ich eine erkennbar falsche Antwort bekomme. Denn die kann ich eher verzeihen, als wenn sogar das Licht einschalten ewig dauert.
Alle Messwerte stammen aus eigenen Durchläufen vom 4. Oktober 2026. Modellpreise laut Preisangabe des Vermittlers zum Testzeitpunkt. Modellangebot und Preise ändern sich schnell; die Zahlen sind eine Momentaufnahme.
zurück