OpenAI заявила, що її дослідники ШІ вже виконують еквівалент 3,1 агентського робочого дня на кожен один людський робочий день, а найактивніші користувачі витрачають понад 7 000 доларів на день на токени для агентних досліджень. За даними Techmeme, компанія називає це досягненням цілі «автоматизованого дослідника-стажера» — орієнтира, який OpenAI публічно ставила собі ще рік тому.

Цифра 3,1 — перший конкретний публічний бенчмарк того, скільки «роботи» реально видає агент у режимі наукового дослідження, а не в демо чи бенчмарку на папері. Для індустрії, яка звикла оцінювати прогрес моделей за абстрактними тестами типу MMLU чи SWE-bench, це радше операційна метрика: скільки паралельних треків дослідження один інженер може тримати одночасно, доручивши їх агентам.

Другий факт — витрати. Понад 7 000 доларів на день на токени в топ-користувачів означає, що агентні дослідницькі цикли всередині OpenAI вже коштують як повноцінна GPU-оренда, а не як «дешевий чат-бот».

Що саме заявила OpenAI?

За даними Techmeme, OpenAI повідомила про досягнення внутрішньої мети «automated research intern» — рівня, коли агент здатний самостійно вести дослідницьку роботу, порівнянну зі стажером-дослідником, а не просто виконувати підказані кроки. Ключовий показник — 3,1 агентського робочого дня на людський робочий день: тобто на кожну годину, яку дослідник-людина витрачає на нагляд і постановку задач, агенти в сумі виконують у 3,1 раза більше «робочого часу» дослідження.

Другий показник компанія назвала окремо: топ-користувачі всередині OpenAI витрачають понад 7 000 доларів на день на токени під час таких агентних досліджень. Це витрати конкретних людей на компанійських дослідницьких проєктах, а не оцінка ринку в цілому.

Звідки береться множник 3,1 агентодня?

Джерело не розкриває методологію підрахунку, тож множник варто читати як внутрішню метрику OpenAI, а не незалежно верифіковане число. Ймовірно, компанія рахує паралельні агентні сесії, які тривають довше за звичайний робочий день людини і працюють без перерв, підсумовуючи їхній сукупний «робочий час» відносно годин, які дослідник витрачає на постановку задач і перевірку результатів.

Раніше компанія вже розкривала деталі того, як прискорює власні AI-дослідження за допомогою внутрішніх агентів — новий показник виглядає продовженням тієї ж лінії звітності про власну продуктивність.

Що означають $7000 на день на токени?

Для порівняння: типовий індивідуальний тариф на API великої мовної моделі рідко перевищує кілька десятків доларів на день навіть за інтенсивного використання. Сума понад 7 000 доларів на день означає, що топ-користувачі OpenAI ганяють паралельно десятки або сотні агентних сесій одночасно — фактично оперують невеликим дослідницьким кластером із власного облікового запису.

Що з цим робити AI-білдерам просто зараз?

Найважливіше в цій заяві — не сам факт «прогресу», а те, що OpenAI вперше публічно прив'язала продуктивність агентів до вимірної одиниці — робочого дня, а не до балу в бенчмарку. За нашою оцінкою, для команд, що будують власні дослідницькі або аналітичні агентні пайплайни, це означає: варто рахувати не тільки якість відповіді агента, а й його «пропускну здатність» — скільки паралельних задач він реально закриває за зміну, і скільки це коштує в токенах на задачу.

Компанія раніше вже публічно визнавала обмеження власних моделей у цьому напрямку — зокрема, що мислення її моделей не є людським у прямому сенсі, а отже й порівняння «агентоднів» із людськими днями лишається метафорою для маркетингу продуктивності, а не строгим інженерним еквівалентом. AiiN вважає, що подібні метрики варто сприймати як орієнтир напрямку розвитку індустрії, а не як готовий KPI для копіювання у власні процеси — методологія OpenAI непублічна, і пряме порівняння з чужими агентними стеками некоректне.

Чи означає це, що агенти замінять дослідників-людей?

Ні, судячи з формулювання самої OpenAI: ціль названа «автоматизованим дослідником-стажером», тобто рівнем молодшого співробітника під наглядом, а не самостійного дослідника. Людина в цій моделі лишається постановником задач і рецензентом результатів.

Скільки коштує запустити подібного агента-дослідника у власній команді?

OpenAI не розкрила точну вартість запуску, лише витрати найактивніших користувачів — понад 7 000 доларів на день на токени. Для більшості команд поза OpenAI реалістичний бюджет буде на порядки нижчим, оскільки таких обсягів паралельних агентних сесій одночасно потребують лише найінтенсивніші внутрішні дослідницькі проєкти.