Ihr Voice-AI-Produkt ist bereits ein Agent Harness
Bei SWE-bench verbessert der Wechsel des Harness um ein LLM den Score um 22 Punkte. Der Wechsel des Modells verbessert ihn um 1.
Diese Lücke ist das, wofür die KI-Engineering-Community die erste Hälfte des Jahres 2026 nach einem Namen suchte. Der Name, der sich durchsetzte, ist das Agent Harness, und die Formulierung ist jetzt allgegenwärtig: Technical Twitter, Engineering-Blogs, Konferenzvorträge. Die Erkenntnis ist entweder offensichtlich oder peinlich, je nachdem, von welcher Seite man sie betrachtet. Nach einem Jahr der Konvergenz von Frontier-Modellen entscheidet das von Ihnen gewählte Modell fast nie darüber, ob Ihr Produkt in der Produktion funktioniert. Was entscheidet, ist alles, was darum herum aufgebaut ist.
Die Zahlen hinter dieser Erkenntnis sind nicht subtil. Laut Stanford-zitierten Arbeiten verbessert sich dasselbe Modell von 46 % auf 80 % Genauigkeit unter verschiedenen Harnesses. LangChain überarbeitete nur das Harness auf Terminal Bench 2.0 und verbesserte seinen Score mit demselben Modell von 52,8 % auf 66,5 %. Vercel reduzierte 80 % der Werkzeuge eines Agenten, sah den Erfolg von 80 % auf 100 % steigen und die Latenz von 724 Sekunden auf 141 Sekunden sinken. Das Gehirn des Agenten änderte sich bei keiner dieser Experimente. Das Ding um das Gehirn herum tat es.
Wenn Sie schon länger produktionsreife KI entwickeln, sollte Sie nichts davon überraschen. Die Branche hat endlich einen Namen für das, was die meisten von uns seit Jahren tun: das Agent Harness bauen.
Was ein Agent Harness tatsächlich ist
Die klarste Definition, die ich gesehen habe, ist die, auf die sich einige verschiedene Autoren geeinigt haben. Ein Agent ist das Modell plus das Harness. Das Modell liefert Ihnen Intelligenz. Das Harness gibt dem Agenten alles andere: die Werkzeugausführung, den Speicher über das Kontextfenster hinaus, die Zustandsbeibehaltung über Turns hinweg, die Berechtigungsgrenzen, die Fehlerbehebung, die Beobachtbarkeit, die Evals, die Regressionen erkennen, das Routing über Anbieter hinweg, die deterministische Orchestrierung, die entscheidet, worüber das Modell in jedem Schritt überhaupt nachdenken darf.
Der Grund, warum sich diese Formulierung im Jahr 2026 durchsetzte, ist, dass die führenden Allzweckmodelle in ihrer Leistungsfähigkeit konvergierten. Die Wahl zwischen den führenden fünf oder sechs Modellen ist selten das, was darüber entscheidet, ob Ihr Produkt funktioniert. Was entscheidet, ist das, was Sie darum herum bauen.
Es gibt eine Korrelation von Addy Osmani, auf die ich immer wieder zurückkomme: Jeder Fehler eines Agenten sollte zu einer dauerhaften Korrektur im Harness führen. Das Harness wird nur enger. Es wird nie lockerer. Ein gutes Agent Harness wird im Laufe der Zeit zu einem Schichtenprotokoll aller Fehlermodi, die Sie in der Produktion gesehen haben, und der spezifischen Leitplanke, die verhindert, dass sie erneut auftreten. Modelle werden gekauft. Harnesses werden angesammelt.
Der Widerspruch, den niemand benennt
Der Diskurs über Agent Harnesses wurde fast ausschließlich auf Coding Agents (Claude Code, Cursor, Codex, Aider) und Allzweckassistenten ausgerichtet. Die zitierten Benchmarks sind SWE-bench, Terminal Bench, GAIA. Die Architekturdiagramme zeigen Dateisystem-Tools, Terminalzugriff, Code-Suche, IDE-Hooks.
Inzwischen baut jedes seriöse Voice-AI-Unternehmen seit Jahren ein Harness unter einem anderen Namen, oft ohne die Vorteile eines gemeinschaftlich geteilten Vokabulars für das, was sie taten.
Denken Sie darüber nach, was ein produktionsreifes Voice-AI-Produkt wie Elba tatsächlich enthält:
- Eine Echtzeit-Sprach-zu-Text- und Text-zu-Sprache-Pipeline mit Anbieterredundanz, da kein einzelner TTS- oder ASR-Anbieter gleichzeitig akzeptable Verfügbarkeit, Latenz und Sprachabdeckung bietet.
- Eine modellunabhängige Orchestrierungsschicht, da die wirkliche Antwort auf die Frage „Welches LLM sollen wir verwenden?“ lautet: „Verschiedene für verschiedene Turns“, sobald man Kosten, Latenz, Sprache und das regulatorische Profil des Kunden berücksichtigt.
- Persistenter Gesprächszustand, da ein 90-sekündiges Gespräch nichts mit dem Kontextfenster des LLM zu tun hat. Der Zustand erstreckt sich über Turns, Modalitäten, Kanalwechsel (Sprache zu WhatsApp zu SMS zu E-Mail) und Sitzungen, wenn ein Anrufer auflegt und am nächsten Tag zurückruft.
- Eine deterministische Workflow-Schicht, die entscheidet, was das Modell in jedem Schritt tun darf. Nicht, weil das Modell die nächste Aktion nicht frei generieren könnte, sondern weil in regulierten Branchen kein System ausgeliefert werden kann, das es dem Modell erlaubt, die nächste Aktion bei einem klinischen oder Versicherungs-Workflow frei zu erfinden.
- Tiefe Integrationen in Kundensysteme: CRM, Versicherungs-Backends, Dispositionssoftware. Das Modell spricht nie mit diesen. Das Harness tut es.
- Beobachtbarkeit und Audit-Protokollierung, die ein klinischer oder operativer Prüfer selbst lesen kann, ohne dass ein Ingenieur sie übersetzt.
- Evals, die spezifisch für den Workflow jedes Kunden sind, bei jeder Veröffentlichung ausgeführt werden und Deployments sperren.
Lesen Sie diese Liste als Beschreibung von Elba, und sie liest sich wie eine Produktspezifikation. Lesen Sie sie als Beschreibung eines Agent Harnesses, und sie liest sich wie Addy Omanis Blogbeitrag. Es ist dasselbe Artefakt, beschrieben unter zwei verschiedenen Vokabularen.
Das ist der Widerspruch. Das Agent Harness wird 2026 als neue Kategorie der Ingenieurarbeit positioniert. Für Voice AI in regulierten Branchen war es vom ersten Tag an die gesamte Arbeit.
Warum diese Umformulierung wichtiger ist, als es scheint
Wenn Sie ein Ingenieur bei einem Voice-AI-Unternehmen sind, ist die Umformulierung aus zwei Gründen wichtig.
Das erste ist intern. Viel Arbeit, die in einem Sprint-Planungsmeeting schwer zu bewerten ist, sieht ganz anders aus, wenn man akzeptiert, dass man ein Agent-Harness-Unternehmen ist, das zufällig Sprache als Oberfläche nutzt. Das Ersetzen eines TTS-Anbieters, das Schreiben der Fallback-Logik für den Fall, dass ein Tool-Aufruf abläuft, das Hinzufügen einer neuen Zustandsform zum Konversationsspeicher, das Erstellen der Evals für den spezifischen Dispositions-Workflow eines neuen Kunden: Diese Arbeit ist das Produkt. Hier liegt die Zuverlässigkeit.
Die Daten stützen dies direkt. Stanfords Zahl, bei der dasselbe Modell unter einem anderen Harness 6x besser abschneidet, ist die Obergrenze. In unserer eigenen Produktionsumgebung kam jeder Zuverlässigkeitsgewinn in den letzten zwölf Monaten vom Harness. Die Modellwechsel, die wir durchgeführt haben (zwischen Anbietern und Modellfamilien), haben die Stückkosten verändert. Sie haben unsere Zuverlässigkeitszahlen nicht verändert. Die Zuverlässigkeitszahlen ändern sich, wenn das Harness enger wird.
Der zweite Grund, warum dies wichtig ist, ist extern. Kunden in regulierten Branchen (Krankenhäuser, Versicherungen, Notdienste, Bankwesen, Regierung) werden immer anspruchsvoller darin, was sie tatsächlich kaufen. Vor einem Jahr lautete die Frage: „Welches Modell verwenden Sie?“ Jetzt lautet sie: „Wie gehen Sie mit einem Tool-Fehler mitten im Anruf um?“, „Was ist Ihr Fallback-Pfad, wenn der primäre TTS-Anbieter ausfällt?“, „Wie garantieren Sie, dass ein bestimmter Workflow befolgt wird, wenn das Modell abweichen möchte?“ Das sind Harness-Fragen. Die Unternehmen, die diese detailliert mit Protokollen beantworten können, gewinnen diese Geschäfte.
Es gibt auch einen Small-Model-Aspekt, über den man ehrlich sein sollte. Einige der triumphaleren Texte über Agent Harnesses im Jahr 2026 haben impliziert, dass ein großartiges Harness jedes Modell zum Funktionieren bringen kann. Das übertreibt es. Ein schlechtes Modell versagt immer noch, mit oder ohne Harness. Die genauere Version der Aussage ist, dass ein großartiges Harness es Ihnen ermöglicht, rationale Kompromisse einzugehen, die Sie sonst nicht eingehen könnten. Sie können einen bestimmten Turn an ein kleineres, billigeres, schnelleres Modell weiterleiten, weil das Harness die Angriffsfläche so weit verengt hat, dass das kleinere Modell bei diesem Turn erfolgreich sein kann. Sie können eine regulierte Sprachinteraktion auf einem souveränen EU-Modell ausführen, ohne Qualitätseinbußen hinnehmen zu müssen, weil das Harness das Problem bereits eingeschränkt hat. Sie können Ihre Inferenzkosten halbieren, ohne dass Ihre Endbenutzer es bemerken. Nichts davon ist mit einem Modell allein möglich.
Was wir beim Aufbau des Elba-Harness gelernt haben
Vier Dinge haben sich über zwei Jahre der Iteration bewährt.
Die deterministische Workflow-Schicht ist im regulierten Sprachbereich nicht verhandelbar. Die erste Version jedes von uns ausgelieferten Workflows ist immer modellgesteuerter und weniger deterministisch. Die zweite Version ist immer deterministischer. Die Produktion lehrt einen schnell, dass „das Modell entscheiden lassen“ für einen internen Prototyp in Ordnung ist und eine Haftung darstellt, sobald ein Kliniker oder ein Versicherungsvertreter am anderen Ende ist. Das Modell leistet immer noch viel Arbeit innerhalb jedes Schritts. Es wählt nur nicht die Schritte aus.
Modellunabhängige Orchestrierung ist eine Überlebensstrategie, keine Marketingfloskel. Wir mussten in den letzten achtzehn Monaten mehrmals die primären LLM-Anbieter wechseln, aus Gründen, die nichts mit der Leistungsfähigkeit zu tun hatten: Preisänderungen, regionale Verfügbarkeit, sich ändernde Unternehmensbedingungen der Anbieter, sich ändernde DSGVO-Positionen. Wenn das Harness Sie an eine Modellfamilie bindet, geben Sie die nächste Preiskrise direkt an Ihre Kunden weiter. Wir haben uns entschieden, nicht in diesem Geschäft tätig zu sein.
Das Harness erhält Anerkennung für die Erfolge und Schuld für die Misserfolge. Wenn ein Anruf gut verläuft, liegt es daran, dass das Harness alles zusammengehalten hat. Wenn ein Anruf fehlschlägt, liegt es fast immer daran, dass das Harness einen Zustand nicht erkennen konnte, den das Modell produziert hat. Omanis Prinzip gilt auch in unserem Maßstab: Jeder Fehler wird zu einer dauerhaften Korrektur im Harness. Wir sammeln langsam eines davon an.
Warum wir intern aufgehört haben, Elba als Voice-AI-Produkt zu bezeichnen
Wenn Sie ein produktionsreifes KI-System entwickeln, das mit Kunden spricht, Workflows ausführt, sich in externe Systeme integriert oder eine Zuverlässigkeits-SLO hat, sind Sie ein Agent-Harness-Unternehmen. Das Modell ist der kleinste Teil dessen, was Sie ausliefern. Die Integrationen, die Orchestrierung, der Zustand, die Fallbacks, die Evals und die Audit-Trails sind das Produkt.
Der Agent-Harness-Diskurs von 2026 ist nützlich, weil er der Branche einen gemeinsamen Namen für Arbeit gibt, die Voice-AI-Teams (und viele andere Produktionsteams) seit langem unter verschiedenen Bezeichnungen leisten. Sobald Sie den Namen haben, werden die architektonischen Entscheidungen klarer. Die Roadmap wird klarer. Das Einstellungsprofil wird klarer.
Wir für unseren Teil beschreiben Elba intern nicht mehr als Voice-AI-Produkt. Es ist ein Agent Harness, das Sprache als eine seiner Oberflächen nutzt. Diese Umformulierung hat nichts am Code geändert, aber fast alles daran, wie wir die nächsten 12 Monate Arbeit planen.