Micro1 — стартап, що постачає компаніям розмічені й перевірені дані для тренування AI-моделей, — повідомив про річний дохід (gross run rate) на рівні $500 млн станом на серпень 2026 року. Це один із найвищих показників серед постачальників тренувальних даних і ознака того, наскільки прибутковим став ринок, який ще кілька років тому вважали технічною периферією AI-індустрії.
Run rate — це не аудитований річний дохід, а екстраполяція поточних місячних надходжень на 12 місяців вперед. Різниця важлива: показник відображає траєкторію компанії в конкретний момент, а не підтверджену річну виручку за звітний період. Втім, навіть як орієнтир цифра $500 млн показова — вона означає, що попит великих AI-лабораторій на якісні людські дані росте швидше, ніж постачальники встигають наростити пропозицію.
За даними TechCrunch, зростання Micro1 відбувається на тлі загального буму AI-тренування: лабораторії масово закуповують людську експертизу для розмітки, оцінки якості та курації даних, яких бракує у відкритому вебі.
Чому дані для тренування раптом коштують так дорого?
Тому що відкритий веб уже вичерпав себе як джерело якісних прикладів. Моделі 2023–2024 років тренували переважно на масовому скрейпі інтернету й дешевій крауд-розмітці — прості завдання на кшталт «відміть об'єкт на фото» коштували центи за штуку. Сучасні лабораторії натомість платять за складніші артефакти: ланцюжки міркувань для reasoning-моделей, експертні оцінки відповідей для RLHF, приклади коду й математичних доведень від інженерів і науковців із профільною освітою.
- Розмітка reasoning-траєкторій для математики й коду — потребує кваліфікованих контракторів, а не масового краудсорсу
- Оцінка відповідей моделі людьми-експертами в RLHF-циклі — пряме джерело сигналу якості
- Red-teaming і стрес-тести на небезпечні відповіді — окрема й дедалі дорожча категорія послуг
- Синтетичні дані під наглядом людини, де AI генерує приклад, а фахівець перевіряє й відбраковує
Це вже інша економіка: платити треба не за клік, а за годину роботи фахівця з профільною кваліфікацією, і саме тому ставки в цьому сегменті виросли на порядок за останні два-три роки.
Як такі компанії, як Micro1, монетизують дані?
Модель типова для сегмента: компанія будує мережу контракторів і профільних експертів, бере замовлення від AI-лабораторій на конкретні датасети чи оціночні pipeline, і монетизує різницю між ставкою для виконавця і ціною для клієнта. Ринок уже не порожній — на ньому також працюють Scale AI, Surge AI, Mercor та інші постачальники, які за останні два роки виросли з нішевих аутсорс-сервісів у мільярдні бізнеси, обслуговуючи великі AI-лабораторії. $500 млн run rate Micro1 показує, що місце на цьому ринку є не лише для одного-двох лідерів.
Що це означає для AI-білдерів і бізнесу?
Якість тренувальних даних стала окремою статтею бюджету, порівнянною за вагою з обчисленнями. Якщо команда fine-tune-ить модель під вузьку задачу, купити розмітку у спеціалізованого постачальника часто дешевше й швидше, ніж наймати й навчати власних анотаторів під разовий проєкт.
- Для короткострокових або вузьких датасетів аутсорс до спеціалізованого постачальника економить час на найм
- Для продуктів із постійним потоком даних власний pipeline розмітки окупається швидше
- Доменна експертиза анотаторів впливає на якість моделі сильніше, ніж просто обсяг даних
Це також пояснює, чому розрив у якості між моделями дедалі частіше визначається не архітектурою, а тим, хто які дані купив і в кого. Ми вже писали, що розрив між відкритими та закритими моделями тане вдвічі швидше — і доступ до якісних даних для fine-tuning усе частіше визначає, хто в цьому змаганні виграє.
Висновок AiiN
За нашою оцінкою, $500 млн run rate Micro1 — це не показник унікального продукту, а симптом ринку, де попит на людську експертизу для AI перевищує пропозицію настільки, що прибутковими стають навіть компанії, які просто добре організували мережу контракторів. Це ринок продавця: поки лабораторії конкурують за кожен відсоток якості моделі, постачальники даних диктують ціну. Для AI-білдерів висновок простий — бюджет на дані варто планувати як окрему статтю витрат, а не додаток до compute, і оцінювати постачальників не за обсягом розмітки, а за кваліфікацією людей, які її виконують.
Що таке gross run rate і чим він відрізняється від виручки?
Run rate — це прогнозний показник: поточний місячний дохід, помножений на 12. На відміну від річної виручки з фінансового звіту, він не проходить аудит і може суттєво змінюватися разом із коливаннями попиту від місяця до місяця.
Хто ще працює на ринку даних для тренування AI?
Серед відомих постачальників — Scale AI, Surge AI, Mercor та інші компанії, які надають розмітку, оцінку відповідей моделей і red-teaming для великих AI-лабораторій; Micro1 — один із гравців цього ж сегмента.
Чи варто стартапу купувати дані в такого постачальника, як Micro1?
Залежить від масштабу задачі: для разового або вузького датасету аутсорс зазвичай економічніший за найм власної команди анотаторів, а для продукту з постійним потоком даних власний pipeline розмітки окупається довгостроково.