Ihr Voice-AI-Produkt ist bereits ein Agent Harness
Bei SWE-bench verbessert der Wechsel des Harness um ein LLM die Punktzahl um 22 Punkte. Der Wechsel des Modells verbessert sie um 1 Punkt.
Diese Lücke ist das, was die KI-Engineering-Community in der ersten Hälfte des Jahres 2026 zu benennen versuchte. Der Name, der sich durchsetzte, ist das Agent Harness, und die Darstellung ist nun allgegenwärtig: technisches Twitter, Engineering-Blogs, Konferenzvorträge. Die Erkenntnis ist entweder offensichtlich oder peinlich, je nachdem, von welcher Seite man sie betrachtet. Nach einem Jahr der Konvergenz von Frontier-Modellen entscheidet das von Ihnen gewählte Modell fast nie darüber, ob Ihr Produkt in der Produktion funktioniert. Was entscheidet, ist alles, was darum herum aufgebaut ist.
Die Zahlen hinter dieser Erkenntnis sind nicht subtil. Laut einer von Stanford zitierten Arbeit erzielt dasselbe Modell unter verschiedenen Harnessn eine Verbesserung von 46 % auf 80 % Genauigkeit. LangChain hat nur das Harness auf Terminal Bench 2.0 neu gestaltet und seine Punktzahl mit demselben Modell darunter von 52,8 % auf 66,5 % verbessert. Vercel hat 80 % der Werkzeuge eines Agenten gestrichen, sah zu, wie der Erfolg von 80 % auf 100 % stieg, und die Latenz fiel von 724 Sekunden auf 141. Das Gehirn des Agenten änderte sich bei keiner dieser Experimente. Das Ding um das Gehirn herum tat es.
Wenn Sie schon länger produktionsreife KI entwickeln, sollte Sie nichts davon überraschen. Die Branche hat endlich einen Namen für das, was die meisten von uns seit Jahren tun: das Agent Harness bauen.
Was ein Agent Harness eigentlich ist
Die klarste Definition, die ich gesehen habe, ist die, auf die sich einige verschiedene Autoren geeinigt haben. Ein Agent ist das Modell plus das Harness. Das Modell liefert die Intelligenz. Das Harness liefert dem Agenten alles andere: die Werkzeugausführung, den Speicher über das Kontextfenster hinaus, die Zustandsverwaltung über Turns hinweg, die Berechtigungsgrenzen, die Fehlerbehebung, die Beobachtbarkeit, die Evals, die Regressionen abfangen, das Routing über Anbieter hinweg, die deterministische Orchestrierung, die entscheidet, worüber das Modell in jedem Schritt überhaupt nachdenken darf.
Der Grund, warum sich diese Darstellung im Jahr 2026 durchsetzte, ist, dass die führenden Allzweckmodelle in ihrer Leistungsfähigkeit konvergierten. Die Wahl zwischen den führenden fünf oder sechs Modellen ist selten das, was darüber entscheidet, ob Ihr Produkt funktioniert. Was entscheidet, ist das, was Sie darum herum bauen.
Es gibt eine Korrelation von Addy Osmani, zu der ich immer wieder zurückkehre: Jeder Fehler eines Agenten sollte zu einer dauerhaften Korrektur im Harness werden. Das Harness wird nur enger. Es wird nie lockerer. Ein gutes Agent Harness wird im Laufe der Zeit zu einer Schicht von Aufzeichnungen über jeden Fehlermodus, den Sie in der Produktion gesehen haben, und die spezifische Leitplanke, die verhindert, dass er erneut auftritt. Modelle werden gekauft. Harnesses werden angesammelt.
Der Widerspruch, den niemand benennt
Der Diskurs über Agent Harnesses wurde fast ausschließlich auf Coding Agents (Claude Code, Cursor, Codex, Aider) und Allzweckassistenten ausgerichtet. Die zitierten Benchmarks sind SWE-bench, Terminal Bench, GAIA. Die Architekturdiagramme zeigen Dateisystem-Tools, Terminalzugriff, Code-Suche, IDE-Hooks.
In der Zwischenzeit baut jedes seriöse Voice-AI-Unternehmen seit Jahren ein Harness unter einem anderen Namen, oft ohne den Vorteil eines gemeinschaftlich geteilten Vokabulars für das, was sie taten.
Denken Sie darüber nach, was ein produktionsreifes Voice-AI-Produkt wie Elba tatsächlich enthält:
- Eine Echtzeit-Spracherkennungs- und Sprachsynthese-Pipeline mit Anbieterredundanz, da kein einzelner TTS- oder ASR-Anbieter gleichzeitig akzeptable Verfügbarkeit, Latenz und Sprachabdeckung bietet.
- Eine modellunabhängige Orchestrierungsschicht, da die wirkliche Antwort auf die Frage „Welches LLM sollen wir verwenden“ lautet: „unterschiedliche für unterschiedliche Turns“, sobald man Kosten, Latenz, Sprache und das regulatorische Profil des Kunden berücksichtigt.
- Persistenter Gesprächszustand, da ein 90-sekündiges Gespräch nichts mit dem Kontextfenster des LLM zu tun hat. Der Zustand erstreckt sich über Turns, Modalitäten, Kanalwechsel (Sprache zu WhatsApp zu SMS zu E-Mail) und Sitzungen, wenn ein Anrufer auflegt und am nächsten Tag zurückruft.
- Eine deterministische Workflow-Schicht, die entscheidet, was das Modell in jedem Schritt tun darf. Nicht, weil das Modell nicht frei die nächste Aktion generieren könnte, sondern weil in regulierten Branchen kein System ausgeliefert werden kann, das es dem Modell erlaubt, die nächste Aktion bei einem klinischen oder Versicherungs-Workflow frei zu erfinden.
- Tiefe Integrationen in Kundensysteme: CRM, Versicherungs-Backends, Dispositionssoftware. Das Modell spricht nie mit diesen. Das Harness tut es.
- Beobachtbarkeit und Audit-Protokollierung, die ein klinischer oder operativer Prüfer selbst lesen kann, ohne dass ein Ingenieur sie übersetzt.
- Evals, die spezifisch für den Workflow jedes Kunden sind, bei jeder Veröffentlichung ausgeführt werden und Deployments sperren.
Lesen Sie diese Liste als Beschreibung von Elba und sie liest sich wie eine Produktspezifikation. Lesen Sie sie als Beschreibung eines Agent Harness und sie liest sich wie Addy Omanis Blogbeitrag. Sie sind dasselbe Artefakt, beschrieben unter zwei verschiedenen Vokabularen.
Dies ist der Widerspruch. Das Agent Harness wird 2026 als neue Kategorie der Ingenieursarbeit positioniert. Für Voice AI in regulierten Branchen ist es seit dem ersten Tag die gesamte Arbeit gewesen.
Warum diese Umbenennung wichtiger ist, als sie scheint
Wenn Sie ein Ingenieur bei einem Voice-AI-Unternehmen sind, ist die Umbenennung aus zwei Gründen wichtig.
Das erste ist intern. Viel Arbeit, die in einem Sprint-Planungsmeeting schwer zu bewerten ist, sieht ganz anders aus, wenn man akzeptiert, dass man ein Agent-Harness-Unternehmen ist, das zufällig Sprache als Oberfläche nutzt. Das Ersetzen eines TTS-Anbieters, das Schreiben der Fallback-Logik für den Fall, dass ein Tool-Aufruf fehlschlägt, das Hinzufügen einer neuen Zustandsform zum Konversationsspeicher, das Erstellen der Evals für den spezifischen Dispositions-Workflow eines neuen Kunden: Diese Arbeit ist das Produkt. Hier liegt die Zuverlässigkeit.
Die Daten untermauern dies direkt. Die Zahl von Stanford, bei der dasselbe Modell unter einem anderen Harness 6x besser abschneidet, ist die Obergrenze. In unserer eigenen Produktionsumgebung kamen alle Zuverlässigkeitsgewinne der letzten zwölf Monate vom Harness. Die von uns durchgeführten Modellwechsel (zwischen Anbietern und Modellfamilien) haben die Stückkosten verändert. Sie haben unsere Zuverlässigkeitszahlen nicht verändert. Die Zuverlässigkeitszahlen ändern sich, wenn das Harness enger wird.
Der zweite Grund, warum dies wichtig ist, ist extern. Kunden in regulierten Branchen (Krankenhäuser, Versicherungen, Notdienste, Bankwesen, Regierung) werden immer anspruchsvoller darin, was sie tatsächlich kaufen. Vor einem Jahr lautete die Frage: „Welches Modell verwenden Sie?“ Jetzt lautet sie: „Wie gehen Sie mit einem Tool-Fehler mitten im Anruf um?“, „Was ist Ihr Fallback-Pfad, wenn der primäre TTS-Anbieter ausfällt?“, „Wie garantieren Sie, dass ein bestimmter Workflow befolgt wird, wenn das Modell abweichen möchte?“ Das sind Harness-Fragen. Die Unternehmen, die diese detailliert mit Protokollen beantworten können, gewinnen diese Geschäfte.
Es gibt auch einen Aspekt kleiner Modelle, der ehrlich erwähnt werden sollte. Einige der triumphaleren Texte über Agent Harnesses im Jahr 2026 haben impliziert, dass ein großartiges Harness jedes Modell zum Laufen bringen kann. Das übertreibt es. Ein schlechtes Modell versagt immer noch, mit oder ohne Harness. Die genauere Version der Aussage ist, dass ein großartiges Harness es Ihnen ermöglicht, rationale Kompromisse einzugehen, die Sie sonst nicht eingehen könnten. Sie können einen bestimmten Turn an ein kleineres, billigeres, schnelleres Modell weiterleiten, weil das Harness die Angriffsfläche so verengt hat, dass das kleinere Modell bei diesem Turn erfolgreich sein kann. Sie können eine Interaktion in regulierter Sprache auf einem souveränen EU-Modell ausführen, ohne Qualitätseinbußen hinnehmen zu müssen, da das Harness das Problem bereits eingeschränkt hat. Sie können Ihre Inferenzkosten halbieren, ohne dass Ihre Endbenutzer es bemerken. Nichts davon ist mit einem Modell allein möglich.
Was wir beim Bau des Elba-Harness gelernt haben
Vier Dinge haben sich über zwei Jahre der Iteration bewährt.
Die deterministische Workflow-Schicht ist bei regulierter Sprache nicht verhandelbar. Die erste Version jedes von uns ausgelieferten Workflows ist immer stärker modellgesteuert und weniger deterministisch. Die zweite Version ist immer deterministischer. Die Produktion lehrt schnell, dass „das Modell entscheiden lassen“ für einen internen Prototyp in Ordnung ist und eine Haftung darstellt, sobald ein Kliniker oder ein Versicherungsvertreter am anderen Ende ist. Das Modell leistet innerhalb jedes Schritts immer noch viel Arbeit. Es wählt nur nicht die Schritte aus.
Modellunabhängige Orchestrierung ist eine Überlebensstrategie, keine Marketingfloskel. Wir mussten in den letzten achtzehn Monaten mehrmals den primären LLM-Anbieter wechseln, aus Gründen, die nichts mit der Leistungsfähigkeit zu tun hatten: Preisänderungen, regionale Verfügbarkeit, sich ändernde Unternehmensbedingungen des Anbieters, sich ändernde DSGVO-Positionen. Wenn das Harness Sie an eine Modellfamilie bindet, geben Sie die nächste Preiskrise direkt an Ihre Kunden weiter. Wir haben uns entschieden, nicht in diesem Geschäft tätig zu sein.
Das Harness erhält Anerkennung für die Erfolge und Schuld für die Misserfolge. Wenn ein Anruf gut verläuft, liegt es daran, dass das Harness alles zusammengehalten hat. Wenn ein Anruf fehlschlägt, liegt es fast immer daran, dass das Harness einen Zustand nicht erkannt hat, den das Modell produziert hat. Osmans Prinzip gilt auch in unserem Maßstab: Jeder Fehler wird zu einer dauerhaften Korrektur im Harness. Wir sammeln langsam eine davon an.
Warum wir intern aufgehört haben, Elba als Voice-AI-Produkt zu bezeichnen
Wenn Sie ein produktionsreifes KI-System entwickeln, das mit Kunden spricht, Workflows ausführt, sich in externe Systeme integriert oder eine Zuverlässigkeits-SLO hat, sind Sie ein Agent-Harness-Unternehmen. Das Modell ist der kleinste Teil dessen, was Sie ausliefern. Die Integrationen, die Orchestrierung, der Zustand, die Fallbacks, die Evals und die Audit-Trails sind das Produkt.
Der Agent-Harness-Diskurs von 2026 ist nützlich, weil er der Branche einen gemeinsamen Namen für Arbeit gibt, die Voice-AI-Teams (und viele andere Produktionsteams) seit langem unter verschiedenen Bezeichnungen leisten. Sobald Sie den Namen haben, werden die architektonischen Entscheidungen klarer. Die Roadmap wird klarer. Das Einstellungsprofil wird klarer.
Wir für unseren Teil beschreiben Elba intern nicht mehr als Voice-AI-Produkt. Es ist ein Agent Harness, das Sprache als eine seiner Oberflächen nutzt. Diese Umbenennung hat nichts am Code geändert, aber fast alles daran, wie wir die nächsten 12 Monate planen.