Стаття «AutoSR: Automatic Symbolic Regression by Searching Research States» з'явилася на arXiv у серпні 2026 року під ідентифікатором 2608.16876v1 — саме такий запис (перші чотири цифри «2608») відповідає стандартному формату arXiv, де перші дві цифри означають рік, а наступні дві — місяць подання препринта. Назва роботи прямо каже, про що йдеться: автоматизація символьної регресії через пошук у просторі так званих «дослідницьких станів», а не класичний перебір формул.

Символьна регресія (SR) — це задача пошуку математичного виразу, який точно описує залежність між вхідними та вихідними даними, на відміну від звичайних моделей машинного навчання, де залежність «зашита» у ваги нейромережі й лишається непрозорою. Результатом SR є не набір коефіцієнтів, а читабельна формула на кшталт y = a·x² + b·sin(x), яку інженер чи фізик може перевірити руками.

Саме тому SR активно використовують там, де важлива не лише точність прогнозу, а й пояснюваність: у фізиці, матеріалознавстві, біології та інженерії. Проблема в тому, що простір можливих формул зростає комбінаторно з кількістю змінних і операторів, тож «сліпий» перебір швидко впирається в обчислювальну стелю — і саме цю проблему намагаються вирішити автоматичні методи SR, до яких, судячи з назви, належить і AutoSR.

Чому символьну регресію так важко автоматизувати?

Головна складність SR — це вибуховий ріст простору пошуку: кожна додана змінна чи оператор (степінь, синус, логарифм) множить кількість можливих комбінацій формул. Класичні інструменти на кшталт генетичного програмування (наприклад, PySR чи gplearn) чи фізично-орієнтований AI Feynman намагаються приборкати цей простір евристиками, обмеженням глибини дерева виразу або підказками про фізичну розмірність величин.

Але евристики залишаються крихкими: одна вдала знахідка формули на одному наборі даних не гарантує, що той самий пошуковий алгоритм ефективно спрацює на іншому. Тому напрямок «автоматичної» SR — коли система сама вибудовує стратегію пошуку, а не покладається на фіксовані налаштування — залишається активною темою досліджень, і саме в цей ряд, за назвою, стає AutoSR.

Що саме пропонує AutoSR?

Ключове слово в назві — «Research States»: автори формулюють сам процес пошуку формули не як плоский перебір виразів, а як послідовність станів. За даними arXiv, повний текст роботи опубліковано під наведеним ідентифікатором, однак стислого офіційного викладу методу поки немає в публічних агрегаторах — тому судити про конкретні бенчмарки чи цифри точності передчасно.

Ймовірно, ідея полягає в тому, щоб трактувати кожен проміжний крок пошуку — часткову формулу, гіпотезу про структуру виразу, результат її перевірки на даних — як окремий «дослідницький стан», між якими система навігує подібно до того, як агент досліджує дерево рішень, а не просто генерує й відкидає кандидатів навмання.

Це узгоджується з ширшою тенденцією останніх двох років: замінювати випадковий чи генетичний пошук у SR на більш структуровані, спрямовані стратегії — включно з підходами, де LLM або агентні системи пропонують і уточнюють гіпотези про формулу ітеративно, а не одноразовим проходом.

Кому і навіщо це може знадобитися?

Якщо ідея AutoSR підтвердиться на практиці бенчмарками (а це варто перевірити у самій статті, а не приймати на віру), потенційна цінність для AI-білдерів і дослідників лежить у кількох площинах:

Висновок AiiN: що з цього варто взяти AI-білдерам

Наша теза проста: сама назва AutoSR фіксує помітний зсув у тому, як дослідники формулюють задачі пошуку — не як оптимізацію над фіксованим простором кандидатів, а як навігацію агента крізь стани, що більше нагадує процес наукового мислення, ніж генетичний алгоритм. За нашою оцінкою, якщо цей фрейм справді працює для символьної регресії, він переноситься і на суміжні задачі автоматизованого відкриття — від пошуку архітектур нейромереж до автоматизованого дизайну експериментів. Але поки немає доступних цифр і порівнянь з базовими методами, розсудливо ставитися до заявок обережно й читати першоджерело, а не покладатися лише на назву.

Що таке символьна регресія простими словами?

Це метод, який замість «чорної скриньки» видає готову математичну формулу, що описує дані, — її можна прочитати, перевірити й пояснити колезі за п'ять хвилин, на відміну від ваг нейромережі.

Чи доступний код AutoSR у відкритому доступі?

Наразі посилання на репозиторій чи реалізацію не фігурує в публічних анотаціях до препринта, тож перевірити це можна лише безпосередньо на сторінці arXiv за наведеним ідентифікатором.

Де прочитати повний текст статті?

Оригінал доступний на arXiv за адресою arxiv.org/abs/2608.16876v1 — там же з'являться майбутні версії препринта, якщо автори оновлять текст після рецензування.