Стартап Inherent, заснований колишніми дослідниками DeepMind, заявив, що його AI-агент перевершив рішення Anthropic та OpenAI у задачі автоматичного відтворення результатів наукових досліджень. Компанія стверджує, що в прямому порівнянні на однакових наукових роботах її система показала вищу точність відтворення висновків, ніж конкуруючі агенти двох найбільших AI-лабораторій світу. Заявка гучна, і перевірити її незалежно поки що складно — але сам факт, що маленький стартап публічно кидає виклик Anthropic і OpenAI на їхньому ж полі, вартий уваги AI-білдерів.

Ідея AI-«напарника» для дослідників з'явилася не на порожньому місці. Наука вже роками потерпає від «кризи відтворюваності»: значну частину опублікованих результатів інші лабораторії просто не можуть повторити через неповний опис методології, приховані параметри чи банальні помилки в коді. Якщо агент навчиться надійно перевіряти, чи витримує стаття повторний прогін, це економить дослідникам місяці ручної перевірки — і саме тому Anthropic та OpenAI теж інвестують у цей напрям.

За даними TechCrunch, засновники Inherent раніше працювали в DeepMind, а їхній продукт позиціонується як агент, що бере на себе рутинну, але критично важливу роботу — читання статті, відтворення коду й експерименту, звірку результатів із заявленими авторами цифрами.

Що саме заявляє Inherent?

За словами компанії, йдеться саме про пряме зіставлення: той самий набір наукових статей, та сама задача — відтворити описаний у роботі результат і порівняти, який агент впорався точніше. Inherent позиціонує себе не як загальний research-асистент, а як вузькоспеціалізований інструмент для перевірки відтворюваності — це вужча, але практичніша ніша, ніж «AI-науковець, що робить відкриття», яку раніше просували деякі конкуренти.

Важливо розуміти межі заяви: бенчмарк і методологію порівняння оприлюднив сам стартап, а не незалежна сторона. Це не применшує технічний результат, але означає, що цифри варто сприймати як старт дискусії, а не остаточний вердикт — типова ситуація для будь-якого молодого AI-стартапу, що змагається з ресурсами Anthropic чи OpenAI.

Чому відтворення досліджень — окрема ліга складності для AI-агентів?

Відтворити чужий науковий результат агенту складніше, ніж написати код за специфікацією, бо задача не має чіткого технічного завдання. Агенту потрібно послідовно:

Кожен із цих кроків — окрема точка відмови, і помилка на будь-якому з них дає хибний висновок «результат не відтворюється» — що для науки не менш шкідливо, ніж сама нездатність повторити експеримент.

Що це означає для перегонів Anthropic, OpenAI та інших лабораторій?

Автоматизація research replication перетворюється на окремий фронт конкуренції agentic AI, і поява Inherent показує, що перевагу тут не гарантують ані масштаб компанії, ані розмір моделі. Anthropic і OpenAI мають незрівнянно більше обчислювальних ресурсів і власні флагманські моделі, але вузькоспеціалізований стартап може випередити їх саме завдяки фокусу: команда з DeepMind, ймовірно, оптимізувала агента конкретно під пайплайн «стаття → код → перевірка», а не адаптувала загального агента під ще одну задачу.

Для AI-лабораторій це сигнал, що research-replication варто розглядати як окремий продуктовий напрям, а не побічний ефект загальних agentic-можливостей моделі. Для університетів і видавництв — шанс отримати доступний інструмент масової перевірки відтворюваності, який раніше вимагав тижнів ручної роботи аспірантів.

Висновок AiiN

Наша теза: незалежно від того, чи витримає заява Inherent незалежну перевірку, сам факт її появи означає, що research replication стає окремим полем бою в agentic AI — зі своїми бенчмарками, стартапами-претендентами і, ймовірно, найближчим часом власними open-source еталонами для порівняння агентів. Для AI-білдерів практичний висновок простий: якщо ви створюєте агента для наукової чи інженерної верифікації, вузька спеціалізація на одній задачі зараз може дати перевагу над спробою «причепити» цю функцію до універсального асистента.

Що таке AI-агент для відтворення досліджень?

Це система, яка самостійно читає наукову статтю, реконструює описаний у ній експеримент чи розрахунок і перевіряє, чи збігається отриманий результат із заявленим авторами. Мета — виявити помилки, неповний опис методології чи неможливість повторити результат без ручного втручання дослідника.

Чи означає перемога Inherent, що Anthropic і OpenAI відстають в agentic AI?

Ні, з одного публічно заявленого стартапом порівняння такий висновок робити зарано. Anthropic і OpenAI лишаються лідерами за ресурсами й масштабом моделей у більшості agentic-задач; результат Inherent показує радше, що вузька спеціалізація дозволяє меншим командам конкурувати на окремих нішевих завданнях.