Діогу Алмейда допоміг навчити штучний інтелект розмовляти з людьми. Метод RLHF, одним зі співавторів якого він був, зробив із сирої мовної моделі ChatGPT — співрозмовника, який ніколи не каже «не знаю» і рідко вміщує відповідь в одне речення.
15 вересня 2026 року його стартап TypeSafe AI показав модель, яка не пише листів, не відповідає на запитання й не підтримує розмову. Jev лише обирає з кількох варіантів і повідомляє, наскільки впевнений у своєму виборі. За кілька днів Vercel і Cloudflare додали Jev на свої платформи, LangChain випустив інтеграцію, а розробники в соцмережах змагалися, хто знайде йому найнесподіваніше застосування. Чому модель, яка мовчить, так зачепила індустрію? Щоб це зрозуміти, варто почати з того, чому її творець пішов з OpenAI.
Людина, яка навчила ШІ говорити, і чому їй цього виявилося замало
В OpenAI Діогу працював над тим, щоб моделі краще виконували інструкції. Саме звідти виріс RLHF — навчання з підкріпленням на основі людського відгуку. Але що більше Діогу спостерігав, як люди використовують ШІ, то сильніше розчаровувався. Суперінтелект, здатний братися за математичні задачі тисячоліття, здебільшого писав рекламні тексти й генерував «веб-сміття. « Причина не в тому, що моделям бракує розуму. Їм бракує правильного інтерфейсу: способу, яким звичайна програма могла б «поговорити» з ШІ й отримати відповідь, на яку можна покластися», — казав він в подкасті.
Втім OpenAI вирішили, що задачу виконання інструкцій розв'язано, і перекинули ресурси на розмовний продукт ChatGPT, тому Діогу пішов.
2024 року він разом з партнерами заснував TypeSafe AI. Два роки команда працювала в стелс-режимі, а вийшла на публіку одразу з $40 млн посівних інвестицій. У прес-релізі Діогу сформулював свою ставку так: «ШІ зрештою має жити всередині програм і тихо працювати у фоні, а люди не можуть бути єдиними його споживачами».
Що таке Jev: перемикач замість співрозмовника
Уявіть, що вам потрібно розібрати тисячу листів і визначити термінові. ChatGPT на кожен напише абзац міркувань і десь посередині скаже, що лист, схоже, терміновий. Jev натомість просто обирає одну із заданих відповідей і каже, наскільки впевнений. Якщо ChatGPT — співрозмовник, то Jev — перемикач.
Jev розуміє лише три види питань, кожне з яких має відповідник у звичайному програмуванні:
Noul — питання «так чи ні», аналог if: відповідь не просто «так», а «так на 87%».
Score — оцінка за шкалою, скажімо, від «не терміново» до «горить». Зручно для сортування й порогів.
Choice — вибір одного з варіантів (до 255), аналог switch/case у коді.
Саме тому розробник і техноблогер Тео Браун назвав Jev приблизно таким же розумним, як оператор switch. Звучить як сарказм, але Браун говорив це із захопленням: модель, яка поводиться передбачувано, як код, і водночас розуміє людську мову.
«Ми тестували Jev на автоматизації роботи з вебзастосунками. Модель працювала без скриншотів: отримувала список кнопок і полів та обирала наступну дію. Одне рішення займало приблизно чверть секунди. За сприятливих умов Jev успішно міг пройтись по 30–60 екранах поспіль, а в одному випадку — 114. Водночас для складніших завдань він міг зупинитися там, де велика мовна модель у поєднанні зі скриптом справлялася краще. Тому наш досвід показав і переваги його швидкості, і межі застосування», — пояснює Іван Савчинський, AI Developer у команді Genesis R&D.
Чому Jev швидший і дешевший
Коли звичайна LLM відповідає на запитання, вона пише текст слово за словом. Робота Jev схожа на заповнення анкети, де потрібно лише ставити галочки. За даними компанії, Jev відповідає за 70-500 мілісекунд, тоді як великим моделям на подібні задачі потрібно від 3 секунд до п'яти з половиною хвилин.
Ціна — $0,042 за мільйон вхідних токенів, а за відповіді TypeSafe не бере грошей узагалі.
«Ми працюємо з трьома основними типами ШІ-систем: автономними агентами, workflows із чіткою послідовністю дій і власними моделями, які навчаємо під конкретні задачі. Jev особливо корисний у workflows, де потрібно швидко й дешево оцінити дані за заданими критеріями. Серед сценаріїв, які ми пробували, — перевірки контенту на відповідність політикам платформ і фільтрація потенційно шкідливих запитів до агентів із розширеним доступом до інструментів. Ще одне перспективне застосування — недороге створення features із текстових даних для навчання власних моделей», — каже Марк Мотлюк, AI Tech Lead в Genesis.
Що нового у Jev: RLCD та декомпозиція
На думку Діогу, RLHF має дві вади, критичні для розробників:
Колапс режимів. Модель, яку постійно оцінюють люди, стає надто обережною: обирає найтиповіші відповіді й відкидає рідкісні, навіть правильні. У чаті цього не видно, але для програми її ймовірності вже не відображають реальності.
Відмови. Фраза «Вибачте, я не можу з цим допомогти» для людини — незручність, а для програми — збій. Діогу називає це катастрофічною «помилкою типу».
Відповідь TypeSafe — RLCD (Reinforcement Learning for Calibrated Decisions), навчання, мета якого — щоб упевненість моделі збігалася з реальністю.
Звичайній мовній моделі дають один великий промпт з усіма правилами й винятками, і що він довший, то більше модель губить і плутає. Це називають «гниттям контексту» (context rot). Jev підштовхує до протилежного: складне рішення розкладається на маленькі питання. Модель відповідає на них паралельно, а логіка рішення переїжджає з промпту в код, де її легко прочитати, перевірити й змінити.
Де Jev уже працює
У перші дні після запуску попит був таким, що TypeSafe ненадовго не впоралася з навантаженням на свій API. Ось три сценарії, які з'явилися найшвидше.
Сортувальник
Найочевидніше застосування Jev — швидко розкласти по поличках листи, тікети, повідомлення чи команди. Інженер Vercel розповів TechCrunch, що компанія використовувала ChatGPT Luna 5.6 від OpenAI, щоб перевіряти команди на безпечність. Після заміни на Jev результати надходили в 5-18 разів швидше і з вищою точністю.
Технічний директор Bryo AI порівняв Jev із Gemini на класифікації бізнес-листів. Gemini виявився трохи точнішим, але в 10–20 разів дорожчим. Проте його найбільше вразило, що Jev — єдина модель, яка повертає справжню ймовірність, а з нею вже можна будувати автоматизацію.
Диспетчер для ШІ-агентів
ШІ-агенти працюють по колу: модель вирішує, що робити, інструмент виконує дію, модель оцінює результат, і так до кінця задачі. Кожне, навіть дрібне рішення — ще один виклик великої моделі, а це повільно й дорого.
LangChain, один з найпопулярніших фреймворків для агентів, показав, як вбудувати Jev у цей цикл. Перший інструмент — маршрутизатор: Jev оцінює запит і вирішує, доручити його дешевій моделі чи потужній. Другий — охоронець Auto Mode: він перевіряє кожну дію агента до виконання і блокує ризиковані, наприклад, якщо агента ввели в оману.
Пройтися по всьому
Коли рішення коштує частки цента, ШІ можна застосувати до всього. Маркетолог Меттью Берман, засновник сервісу для аналізу реклами StealAds, за 40 секунд і 9 центів розібрав за допомогою Jev 724 рекламні оголошення 37 брендів.
Відкритий інструмент JevSEO перевіряє вебсторінку за 45 параметрами приблизно за соту частку цента.
Що далі: агент без «тиранії KV-кешу»
Публічний пост Діогу про кодинг-агентів показує, який вектор обирає компанія. Він помічає, що кодинг-агенти на кшталт Claude Code чи Codex влаштовані напрочуд просто: це цикл, який крутиться, доки задачу не виконано, плюс кілька інструментів — прочитати файл, знайти текст, виконати команду. Моделі можна брати найкращі через API, відкритого коду вдосталь, тож чому б не збудувати власного агента, але вже з Jev усередині? Далі Діогу ставить запитання, яке, за його словами, любить ставити колегам: як би ви спроєктували такого агента, якби в мовних моделей не було KV-кешу?
KV-кеш — це своєрідна пам'ять моделі. Прочитавши довгу розмову, модель зберігає результат, щоб не перечитувати все заново з кожним новим повідомленням. Це економить гроші й час, але, як показує Діогу, непомітно диктує, як влаштовані всі сучасні агенти.
Найнесподіваніший наслідок — розумна маршрутизація може не працювати. Здавалося б, логічно віддати просту частину задачі дешевшій моделі, а потім повернутися до дорогої. Але, повернувшись, дорога модель мусить заново прочитати весь контекст, що за цей час виріс. Діогу порахував це на прикладі дорогої Opus і дешевшої Sonnet від Anthropic: робота лише з Opus вийшла приблизно на третину дешевшою, ніж з перемиканням. Схожі проблеми Діогу бачить і деінде: описи всіх інструментів агента займають купу місця в контексті, навіть коли більшість не потрібна, а довгі розмови стискаються в підсумок наосліп, хоча стиснути щось, знаючи, що шукаєш, набагато простіше.
Корінь у тому, що контекст агента вважається статичним: одна довга стрічка, яка лише росте. Діогу пропонує від цього відмовитися й називає свою ідею «мета-увагою». Під кожен новий запит агент заново збирає контекст, куди потрапляє лише те, що справді стосується справи. Jev ставить запитання до кожного шматка історії, від результатів команд до реплік користувача, і вирішує: не показувати, показати коротко чи повністю. Якщо це запрацює, агент зможе мати сотні вбудованих інструментів і тисячі сторінок документації, які підвантажуються лише тоді, коли потрібні.
Скептики та незручні запитання
Будь-який гучний запуск у світі ШІ за кілька днів обростає не лише захопленими відгуками, а й критикою. Ось головні претензії до Jev.
1. Він менш точний. За даними, які наводить Forbes, середня точність Jev на робочих задачах — 67,8% проти 74,1% у найкращого конкурента. В одному з тестів Jev знайшов у текстах шість із семи навмисно захованих помилок, а Claude Fable 5.1 — усі сім. Зате Jev упорався приблизно у 25 разів швидше й за 1/580 вартості.
2. «Не галюцинує» — це півправди. Jev не може видати відповідь, якої немає в списку, але може впевнено обрати не ту. Армін Ронахер, творець Python-фреймворку Flask, сказав TechCrunch, що Jev трохи перекладає проблему галюцинацій на користувача. Тому все тримається на калібруванні: якщо впевненість моделі чесна, помилки ховатимуться серед сумнівних відповідей.
«У наших тестах результат суттєво залежав від того, як ми представляли моделі вміст сторінки. Якщо нестандартна кнопка не потрапляла до списку доступних елементів, Jev не міг її обрати. Після доопрацювання підготовки даних середня глибина проходження зросла з 2 до 36 екранів. Водночас модель іноді порушувала прямі інструкції: поверталася назад, потрапляла в цикли або повторювала вже виконані дії. Тому критичні обмеження потрібно забезпечувати на рівні коду. Самих інструкцій у промпті для надійної роботи недостатньо», — каже Іван Савчинський.
3. Це чорна скринька. TypeSafe не опублікувала ні архітектури Jev, ні ваг, ні технічного опису RLCD, тож перевірити, чи впевненість справді чесна, поки неможливо. Дехто підозрює, що всередині — одна з відкритих мовних моделей, навчена по-новому.
4. Немає незалежних публічних бенчмарків. Тут TypeSafe має принципову позицію. Діогу не вірить публічним бенчмаркам: у подкасті він пояснює, що їх надто легко «підігнати», і багато лабораторій збирають дані, схожі на популярні тести на кшталт MMLU, щоб завищити результати. Справжній інтелект, на його думку, має невловиму якість, яку статичні метрики не здатні виміряти, тож моделі варто оцінювати на власних задачах.
5. Його легко скопіювати. Розробники з NobodyWho опублікували пародійний пост «Jev у 25 рядках Python»: навчили крихітну відкриту модель на своєму комп'ютері класифікувати листи з імовірностями, і фішинговий лист вона впевнено визначила як фішинг — на 88,5%. Щоправда, методом RLCD модель не навчали, тож її відсоткам не можна так довіряти. Тобто пародія ненавмисно показала, що справжня цінність Jev — саме в калібруванні. За тиждень з'явилися й серйозніші відкриті копії, зокрема OpenJev.
6. Залежність від одного постачальника. API Jev пропрієтарний, тож переходити з нього на щось інше означатиме переписувати цілий шар коду. А що завадить OpenAI чи Google запропонувати подібне вже за кілька місяців, поки невідомо.
Діогу Алмейда сам запропонував, за чим судити про його успіх: не за кількістю користувачів чи рейтингами, а за тим, чи зросте продуктивність економіки хоча б на 3% за п'ять років. Повноцінних незалежних перевірок Jev поки немає, тож і відповіді на це питання ще немає. Але якщо він має рацію, найкориснішим ШІ майбутнього може стати той, якого ми навіть не помітимо.















