Nyilvános minőségi bizonyíték · 2026. augusztus 14.

Két futás.
Kétszer 22/22.

Az Apex AI chatbot minden kiadás előtt kereskedelmi pontosságot, biztonságot, kontextusmemóriát és cselekvési őszinteséget mérő teszteken megy át. Itt nem jelzőket mutatunk, hanem az eredményt és a bizonyossági határt.

Reprodukálható release gate: PASS
22/22Apex kiadási teszt, 1. futás

Nyolc kategória, köztük árpontosság, biztonság és többkörös memória.

22/22Apex kiadási teszt, 2. futás

Azonnali ismétlésben is azonos funkcionális és biztonsági eredmény.

14/14Apex azonos corpuson

Intercom Fin: 5/14 ugyanazon single-turn feladatsor determinisztikus értékelésében.

Azonos tudás, azonos kérdések

A lezárt összevetés eredménye

A 14 single-turn esetben mindkét rendszer ugyanazt a befagyasztott Apex tudáskorpuszt és ugyanazokat a kérdéseket kapta. A pontozás előre rögzített kötelező és tiltott jelek alapján történt.

RendszerTeljesítettArány
Apex Web14 / 14100%
Intercom Fin5 / 1435,7%
Mit mértünk?

Nem egyetlen szép választ

A release gate a leggyakoribb üzleti hibákra céloz: kitalált ár vagy integráció, túl hosszú árlista, hamis műveletállítás, magas kockázatú tanács, elvesztett kontextus és hibás értékesítési lezárás.

01

Kereskedelmi pontosság

Rövid, releváns ár, ismert vállalkozási tények használata és kitalált feed- vagy platformkontextus tiltása.

02

Biztonsági határok

Adózási, adatvédelmi és prompt injection helyzetekben egyértelmű emberi ellenőrzés és műveleti korlát.

03

Többkörös memória

A csomagválasztó megszakítás után ugyanott folytat, nem fogyaszt el mezőt egy közbevetett kérdéssel.

04

Cselekvési őszinteség

A chatbot csak azt mondja megtörténtnek, ami ténylegesen megtörtént. Foglalást, mentést vagy hívást nem színlel.

Bizonyossági határ

Erős eredmény. Nem univerzális világelsőségi bizonyíték.

Ez belső, reprodukálható kiadási kapu és saját összehasonlító mérés, nem független tanúsítás. A lezárt 14-es összevetés single-turn teljesítményt mér. Nem bizonyít univerzális világelsőséget, minden iparágra érvényes fölényt vagy jobb valós üzleti eredményt.

  • Chatbase: 16/22 eset futott le, ezért teljes összehasonlító pontszámot nem közlünk.
  • Tidio: 1/22 eset futott le, ezért teljes összehasonlító pontszámot vagy minőségi következtetést nem közlünk.
  • Valós outcome-kapu: 10 külön beszélgetésből 4 többkörös és 4 leadet tartalmazott; a cél 100 kvalifikált beszélgetés.
  • AI recepciós és automatizáció külön, azonosan szigorú mérési kaput kap; pontszámot csak lezárt proof után teszünk közzé.
Géppel olvasható eredmény: chatbot-benchmark.json