Як avatarin побудував голосового retail-агента на GPT-Realtime
Кейс avatarin і Yamada Holdings показує, як перетворити знання продавців-консультантів на цілодобового мультимовного голосового агента для вибору побутової техніки — із grounded-каталогом, керуванням затримкою, безпечним handoff і вимірюванням корисного результату.
Картка кейсу
Що тут автоматизовано
Обсяг автоматизації
Мультимовна голосова консультація 24/7: уточнення потреб, пояснення товарів і навігація вибором на основі контрольованого каталогу та знань продавців.
Роль людини
Retail-експерти курують знання й правила рекомендацій, перевіряють складні або ризикові запити, приймають handoff і відповідають за актуальність цін, наявності та умов продажу.
Заявлені результати
- приблизно 30 000 покупців взаємодіяли з агентом протягом двотижневої публічної кампанії за даними OpenAI
- 92% відповідей у post-use survey були позитивними за даними OpenAI
Verified Case Study: опис кампанії та результати походять із customer story OpenAI від 30 липня 2026 року. Production-архітектура, authority matrix, eval plan і pilot scorecard нижче є редакційною моделлю AI-Magister, а не твердженням про нерозкриту реалізацію avatarin або Yamada Holdings.
Зміст статті
- 01Проблема: експерт продавця не масштабується після закриття магазину
- 02Що змінює realtime voice у shopping journey
- 03Архітектура: голос — інтерфейс, каталог — джерело правди
- 04Authority: порада, резервування і продаж — різні повноваження
- 05Як читати 30 000 користувачів і 92% позитивних відповідей
- 06Мультимовність і бренд не зводяться до перекладу
- 0780/20 pilot: одна категорія й один перевірюваний outcome
Передумови
Проблема: експерт продавця не масштабується після закриття магазину
Покупець побутової техніки рідко шукає лише одну характеристику. Йому треба зіставити розмір помешкання, звички сім’ї, бюджет, енергоспоживання, умови встановлення й сумісність із уже наявною технікою. Каталог дає фільтри, але не завжди пояснює компроміс людською мовою; контакт-центр дає діалог, проте має години роботи, чергу та мовні обмеження.
OpenAI описує, як avatarin разом із Yamada Holdings перенесли частину досвіду консультантів у Kurashi-Marugoto AI Agent на GPT-Realtime. Агент працює цілодобово, підтримує природну голосову розмову кількома мовами й веде користувача від формулювання потреби до рішення про покупку. Пошуковий намір цієї сторінки вузький: production-патерн synchronous voice retail, а не загальна автоматизація customer journey Cars24 чи текстовий inbound sales workflow OpenAI.
architecture
Карта системи: Як avatarin побудував голосового retail-агента на GPT-Realtime
Що змінює realtime voice у shopping journey
У текстовому чаті користувач терпить невелику паузу й бачить, де закінчилася відповідь. У голосі затримка, перебивання, тиша та помилкове визначення завершення репліки стають частиною якості продукту. Асистент має швидко підтвердити почуте, дозволити користувачу перебити довге пояснення, відновитися після шуму й не виконувати нову дію двічі через повторену фразу.
Realtime API дає двосторонню сесію для низьколатентного multimodal interaction, але transport сам по собі не робить консультацію коректною. Application layer усе одно володіє session identity, дозволеними tools, retrieval, business rules і журналом подій. Практична одиниця дизайну — не один довгий prompt, а короткий turn із явними станами listening, clarifying, retrieving, recommending, confirming та handing_off.
- turn detection і контроль перебивань;
- короткі voice-first відповіді замість довгих каталогових абзаців;
- явне повторне підтвердження моделі, ціни й ключової умови;
- відновлення після network drop без дубльованої дії;
- перехід у текст або до людини, коли голосовий канал незручний.
timeline
Контрольні точки для практичного застосування
- turn detection і контроль перебивань;
Контрольна теза з матеріалу статті.
- короткі voice-first відповіді замість довгих каталогових абзаців;
Контрольна теза з матеріалу статті.
- явне повторне підтвердження моделі, ціни й ключової умови;
Контрольна теза з матеріалу статті.
- відновлення після network drop без дубльованої дії;
Контрольна теза з матеріалу статті.
- перехід у текст або до людини, коли голосовий канал незручний.
Контрольна теза з матеріалу статті.
- agent-evaluation
Архітектура: голос — інтерфейс, каталог — джерело правди
Відтворювана система починається з audio channel, який передає репліки в realtime session. Оркестратор зберігає conversation state, визначає, коли потрібне уточнення, й запитує контрольований product retrieval. Retrieval повертає лише актуальні SKU, специфікації, availability timestamp і source ID; policy layer відсіює несумісні або заборонені рекомендації; response layer формує стислу усну відповідь.
Це редакційна reference architecture AI-Magister. Публічна історія не розкриває точний retrieval stack avatarin, правила кешування або system-of-record integration. Проте межа є обов’язковою для будь-якого повторення: модель може пояснювати різницю між двома холодильниками, але не повинна вигадувати наявність, ціну, гарантію чи доставку. Кожне динамічне твердження має походити з актуального tool result і мати час отримання.
- Audio channel → stream, interruption і reconnect;
- Session state → мова, потреби, shortlist і consent;
- Retrieval → каталог, характеристики та expert knowledge;
- Policy → compatibility, claims і promotion boundaries;
- Response → коротка grounded voice reply;
- Handoff → transcript, selected products і unresolved question;
- Evidence → trace, source IDs, latency та outcome events.
Як читати 30 000 користувачів і 92% позитивних відповідей
За customer story OpenAI, приблизно 30 000 людей скористалися агентом у двотижневій публічній кампанії, а 92% відповідей у post-use survey були позитивними. Перше число показує масштаб залучення в конкретній активації; друге описує думку респондентів опитування. Вони не дорівнюють conversion rate, частці вирішених задач або незалежно виміряній точності рекомендацій.
Для власного pilot треба зберігати denominator: скільки сесій почалося, скільки користувачів дійшли до сформульованої потреби, отримали grounded shortlist, попросили людину, завершили розмову після помилки або погодили наступний крок. Survey response rate публікують поруч із позитивною часткою. Окремо вимірюють unsupported product claims, stale availability, p50/p95 turn latency, interruption recovery та repeat-question rate.
Мультимовність і бренд не зводяться до перекладу
Мультимовний voice agent має розуміти product vocabulary, числа, одиниці вимірювання, назви моделей і перемикання мов усередині розмови. Literal translation може спотворити safety instruction або зробити локальну торгову умову універсальною. Тому eval set розділяють за мовами й містить вимову SKU, адреси, шум, акценти, code-switching та запит повторити критичну цифру.
Brand voice також не дає права імпровізувати. Hospitality можна кодувати через тон, довжину відповіді й способи уточнення, тоді як factual claims залишаються grounded. Якщо користувач просить медичну, електричну або монтажну пораду поза перевіреною базою, агент називає межу й передає діалог фахівцю. Хороша особистість зменшує тертя; вона не маскує відсутність доказів.
80/20 pilot: одна категорія й один перевірюваний outcome
Почніть не з усього магазину, а з категорії з чіткими attributes і низькою ціною помилки, наприклад очищувачів повітря. Агент уточнює площу, шумові обмеження, бюджет і важливі функції, отримує актуальний shortlist із каталогу, пояснює компроміси та пропонує перейти на product page або до консультанта. Замовлення й фінансування лишаються поза першим authority scope.
Release gate вимагає grounded recommendation на representative eval set, нуль вигаданих SKU, контрольовану latency, успішне recovery після interruption і повний handoff packet. Лише потім додають нову категорію або reversible tool. Така послідовність відділяє корисного retail-агента від голосового демо: система доводить один customer outcome, а не просто здатність підтримувати приємну розмову.
Практичні приклади
Pilot для вибору очищувача повітря
Eval cohort містить маленькі й великі кімнати, нічний режим, алергії без медичних обіцянок, відсутній товар, застарілу promotion, схожі назви SKU, шумний запис і перемикання української та англійської. Agent повертає не більше трьох актуальних позицій із source IDs, повторює критичні параметри, не резервує товар і передає людині transcript, constraints та shortlist. Primary outcome — grounded next step; guardrails — zero invented products і zero unsupported health claims.
FAQ
Чи доводить 92% positive survey високу точність рекомендацій?
Ні. Це reported частка позитивних відповідей серед учасників post-use survey. Для точності потрібні окремі groundedness, task-success і unsupported-claim metrics із відомим denominator.
Чому кейс має Automation Level A3, а не A4?
Публічне джерело підтверджує автономну 24/7 голосову консультацію, але не дає достатніх доказів самостійного виконання покупки, платежу чи іншої consequential action.
Яку категорію запускати першою?
Оберіть одну категорію зі структурованими атрибутами, актуальним каталогом і низькою ціною помилки; вимірюйте grounded shortlist та наступний крок до розширення tool authority.
Пов’язані матеріали
OpenAI побудував inbound sales assistant, який підтягує product docs, policies, customer stories і playbooks, відповідає лідам їхньою мовою, передає кваліфіковані діалоги sales reps із контекстом і використовує eval loop для контролю якості.
Як Cars24 автоматизує customer journey за допомогою OpenAI-агентівCars24 використовує voice і chat agents на OpenAI API не для одного FAQ, а для зв’язного customer journey: від підбору авто й test drive до financing, re-engagement втрачених лідів, after-sales support і контрольованих внутрішніх операцій.
Speech AI: ASR і TTSАрхітектура мовленнєвих систем: audio ingestion, voice activity detection, automatic speech recognition, diarization, punctuation, text-to-speech, streaming, evaluation, приватність і захист від голосових атак.
Tool calling і контракти інструментівЯк дозволити LLM викликати функції без передачі їй необмежених повноважень: schema, policy, idempotency, timeouts, verification і audit trail.
State machines для агентівState machines для агентів — практичний розбір production-архітектури: відокремлення ймовірнісного рішення моделі від детермінованого життєвого циклу виконання. Матеріал охоплює контракти, межі повноважень, failure modes, оцінювання та контрольований rollout.
Human-in-the-loop для AIHuman-in-the-loop для AI — практичний розбір production-архітектури: залучення людини в конкретній точці ризику з достатнім контекстом для реального, а не формального контролю. Матеріал охоплює контракти, межі повноважень, failure modes, оцінювання та контрольований rollout.
Оцінювання AI-агентівОцінювання AI-агентів — практичний розбір production-архітектури: вимірювання не лише фінальної відповіді, а всієї траєкторії рішень, дій, витрат і безпечного завершення. Матеріал охоплює контракти, межі повноважень, failure modes, оцінювання та контрольований rollout.