Váš hlasový AI produkt je už „agent harness“
Na SWE-bench posouvá přepnutí „harnessu“ kolem LLM skóre o 22 bodů. Přepnutí modelu posouvá skóre o 1.
Tento rozdíl je to, co se komunita AI inženýrů snažila první polovinu roku 2026 pojmenovat. Název, který se ujal, je „agent harness“ a toto pojmenování je nyní všude: technický Twitter, inženýrské blogy, konferenční přednášky. Zjištění je buď zřejmé, nebo trapné, v závislosti na tom, z jaké pozice se na to díváte. Po roce konvergence špičkových modelů to, jaký model si vyberete, téměř nikdy nerozhoduje o tom, zda váš produkt funguje v produkci. Rozhoduje vše, co je kolem něj.
Čísla stojící za tímto zjištěním nejsou subtilní. Práce citovaná Stanfordem ukazuje, že stejný model se pod různými „harnessy“ zlepšuje ze 46 % na 80 % přesnost. LangChain přepracoval pouze „harness“ na Terminal Bench 2.0 a se stejným modelem pod ním posunul své skóre z 52,8 % na 66,5 %. Vercel snížil 80 % nástrojů agenta, sledoval nárůst úspěšnosti z 80 % na 100 % a snížení latence ze 724 sekund na 141. Mozek agenta se v žádném z těchto experimentů nezměnil. Změnila se věc kolem mozku.
Pokud se tvorbě produkční AI věnujete delší dobu, nic z toho by vás nemělo překvapit. Odvětví má konečně název pro to, co většina z nás dělá léta: budování „agent harness“.
Co je „agent harness“ vlastně
Nejčistší definice, jakou jsem viděl, je ta, na které se shodlo několik různých autorů. Agent je model plus „harness“. Model vám dává inteligenci. „Harness“ dává agentovi vše ostatní: provádění nástrojů, paměť přesahující kontextové okno, perzistenci stavu napříč konverzacemi, hranice oprávnění, obnovu po chybách, pozorovatelnost, evaluace, které zachytí regrese, směrování napříč poskytovateli, deterministickou orchestraci, která rozhoduje, o čem model vůbec může v daném kroku přemýšlet.
Důvodem, proč se toto pojmenování v roce 2026 ujalo, je to, že špičkové univerzální modely dosáhly konvergence ve svých schopnostech. Volba mezi pěti nebo šesti předními modely málokdy rozhoduje o tom, zda váš produkt funguje. Rozhoduje to, co kolem nich postavíte.
Existuje paralela od Addyho Osmaniho, ke které se neustále vracím: každá chyba agenta by měla být v „harnessu“ trvale opravena. „Harness“ se pouze utahuje. Nikdy se nepovoluje. Dobrý „agent harness“ se časem stává vrstveným záznamem každého chybového režimu, který jste viděli v produkci, a specifického ochranného mechanismu, který zabrání jeho opakování. Modely se kupují. „Harnessy“ se hromadí.
Rozpor, který nikdo nenazývá
Diskurz o „agent harness“ byl téměř výhradně zaměřen na kódovací agenty (Claude Code, Cursor, Codex, Aider) a univerzální asistenty. Citované benchmarky jsou SWE-bench, Terminal Bench, GAIA. Architektonické diagramy ukazují nástroje pro souborový systém, přístup k terminálu, vyhledávání kódu, integrace s IDE.
Mezitím každá seriózní společnost zabývající se hlasovou AI již roky buduje „harness“, pod jiným názvem, často bez výhody sdíleného komunitního slovníku pro to, co dělala.
Představte si, co všechno obsahuje produkční hlasový AI produkt, jako je Elba:
- Potrubí pro převod řeči na text a textu na řeč v reálném čase, s redundancí poskytovatelů, protože žádný jediný dodavatel TTS nebo ASR nemá současně přijatelnou dostupnost, latenci a pokrytí jazyků.
- Orchestrační vrstva nezávislá na modelu, protože skutečná odpověď na otázku „který LLM bychom měli použít“ se ukáže být „různé pro různé kroky konverzace“, jakmile zohledníte náklady, latenci, jazyk a regulační profil zákazníka.
- Perzistentní stav konverzace, protože 90sekundový hovor nemá nic společného s kontextovým oknem LLM. Stav pokrývá jednotlivé kroky konverzace, modality, přepínání kanálů (hlas na WhatsApp, SMS, e-mail) a relace, když volající zavěsí a zavolá znovu následující den.
- Deterministická vrstva pracovního postupu, která rozhoduje, co model smí v každém kroku dělat. Ne proto, že by model nemohl volně generovat další akci, ale proto, že v regulovaných odvětvích nemůžete nasadit systém, který modelu umožňuje volně vymýšlet další akci v klinickém nebo pojišťovacím pracovním postupu.
- Hluboké integrace do zákaznických systémů: CRM, pojišťovací backendy, software pro dispečink. Model se s nimi nikdy přímo nespojí. To dělá „harness“.
- Pozorovatelnost a auditní záznamy, které může klinický nebo provozní auditor číst sám, bez překladu inženýra.
- Evaluace specifické pro pracovní postup každého zákazníka, spouštěné při každém vydání a blokující nasazení.
Přečtěte si tento seznam jako popis Elba a bude to znít jako specifikace produktu. Přečtěte si ho jako popis „agent harness“ a bude to znít jako blogový příspěvek Addyho Osmaniho. Jsou to stejné artefakty, popsané pod dvěma různými slovníky.
Toto je rozpor. „Agent harness“ je v roce 2026 prezentován jako nová kategorie inženýrské práce. Pro hlasovou AI v regulovaných odvětvích to byla celá práce od prvního dne.
Proč toto nové pojmenování znamená víc, než se zdá
Pokud jste inženýr v jakékoli společnosti zabývající se hlasovou AI, toto nové pojmenování je důležité ze dvou důvodů.
První je interní. Mnoho práce, kterou je těžké ocenit při plánování sprintu, začíná vypadat velmi odlišně, jakmile přijmete, že jste společnost budující „agent harness“, která náhodou používá hlas jako povrch. Nahrazení poskytovatele TTS, napsání záložní logiky pro případ, že volání nástroje vyprší, přidání nového tvaru stavu do úložiště konverzací, budování evaluací pro specifický pracovní postup nového zákazníka: tato práce je produkt. Je to místo, kde sídlí spolehlivost.
Data to přímo potvrzují. Číslo ze Stanfordu, kde stejný model pod jiným „harness“ funguje 6x lépe, je horní hranice. V našem vlastním produkčním prostředí každé vítězství ve spolehlivosti za posledních dvanáct měsíců přišlo z „harnessu“. Výměny modelů, které jsme provedli (napříč poskytovateli a rodinami modelů), změnily jednotkové ekonomiky. Nezměnily naše čísla spolehlivosti. Čísla spolehlivosti se mění, když se „harness“ utáhne.
Druhý důvod, proč je to důležité, je externí. Zákazníci v regulovaných odvětvích (nemocnice, pojišťovny, záchranné služby, bankovnictví, vláda) jsou stále sofistikovanější ohledně toho, co si vlastně kupují. Před rokem byla otázka „jaký model používáte“. Nyní je to „jak řešíte selhání nástroje uprostřed hovoru“, „jaká je vaše záložní cesta, když primární poskytovatel TTS degraduje“, „jak zaručíte, že se bude dodržovat konkrétní pracovní postup, když se model chce odchýlit“. To jsou otázky týkající se „harnessu“. Společnosti, které na ně dokážou podrobně odpovědět, s logy, tyto obchody vyhrávají.
Existuje také úhel pohledu malých modelů, o kterém je třeba upřímně mluvit. Některé z nejvíce triumfálních textů o „agent harness“ v roce 2026 naznačovaly, že skvělý „harness“ může rozchodit jakýkoli model. To ho přeceňuje. Špatný model stále selhává, s „harness“ nebo bez něj. Přesnější verze tvrzení je, že skvělý „harness“ vám umožňuje racionálně dělat kompromisy, které byste jinak nemohli. Můžete směrovat konkrétní krok na menší, levnější, rychlejší model, protože „harness“ dostatečně zúžil povrchovou oblast, aby menší model mohl v tomto kroku uspět. Můžete spustit interakci v regulovaném jazyce na suverénním modelu EU bez snížení kvality, protože „harness“ již problém omezil. Můžete snížit svůj účet za inferenci na polovinu, aniž by si toho vaši koncoví uživatelé všimli. Nic z toho není možné pouze s modelem.
Co jsme se naučili při budování „harnessu“ pro Elba
Čtyři věci se osvědčily při dvouletém iterování na tomto.
Deterministická vrstva pracovního postupu je v regulované hlasové komunikaci nediskutovatelná. První verze každého pracovního postupu, který nasadíme, je vždy více řízena modelem a méně deterministická. Druhá verze je vždy více deterministická. Produkce vás rychle naučí, že „nechat rozhodnout model“ je v pořádku pro interní prototyp a představuje riziko, jakmile je na druhé straně lékař nebo pojišťovací agent. Model stále odvádí spoustu práce uvnitř každého kroku. Jen si nevybírá kroky.
Orchestrace nezávislá na modelu je strategie přežití, nikoli marketingové heslo. V posledních osmnácti měsících jsme museli několikrát změnit primární poskytovatele LLM z důvodů, které neměly nic společného se schopnostmi: změny cen, regionální dostupnost, změny podnikových podmínek dodavatele, změny postojů k GDPR. Pokud vás „harness“ váže k rodině modelů, přenášíte další cenovou krizi přímo na své zákazníky. My jsme se rozhodli v tomto byznysu nebýt.
„Harness“ dostává uznání za vítězství a vinu za prohry. Když hovor proběhne dobře, je to proto, že „harness“ vše držel pohromadě. Když hovor selže, je to téměř vždy proto, že „harness“ nedokázal zachytit stav, který model vyprodukoval. Osmaniho princip platí i v našem měřítku: každá chyba se stává trvalou opravou v „harnessu“. Pomalu jeden takový shromažďujeme.
Proč jsme interně přestali nazývat Elba produktem hlasové AI
Pokud stavíte jakýkoli produkční AI systém, který komunikuje se zákazníky, provádí pracovní postupy, integruje se s externími systémy nebo má SLO spolehlivosti, jste společností budující „agent harness“. Model je nejmenší částí toho, co dodáváte. Integrace, orchestrace, stav, záložní řešení, evaluace a auditní záznamy jsou produkt.
Diskurz o „agent harness“ z roku 2026 je užitečný, protože dává odvětví sdílený název pro práci, kterou týmy hlasové AI (a mnoho dalších produkčních týmů) dělají pod různými označeními po dlouhou dobu. Jakmile máte název, architektonická rozhodnutí se stávají jasnějšími. Roadmapa se stává jasnější. Profil pro nábor se stává jasnějším.
My jsme prozatím interně přestali popisovat Elba jako produkt hlasové AI. Je to „agent harness“, který používá hlas jako jednu ze svých povrchů. Toto nové pojmenování nezměnilo nic na kódové základně, ale téměř vše na tom, jak plánujeme dalších 12 měsíců práce.