ИИ демонстрирует успехи в объяснении открытий, но не в прогнозировании результатов

Добавь сайт в закладки нажми CTRL+D

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Анализ 6 передовых ИИ-систем на 4 760 научных событий показал, что модели эффективно распознают потенциальные механизмы будущих достижений, но практически не способны оценивать сроки и вероятность реальных прорывов

Современные системы искусственного интеллекта успешно объясняют уже известные научные концепции, однако пока не могут надежно предсказать будущие открытия. Это было продемонстрировано исследованием с использованием системы оценки CUSP (Cutoff-conditioned Unseen Scientific Progress), которая проверяла способность ИИ предсказывать реальные научные события в 8 областях.

Авторы CUSP проанализировали 4 760 научных событий, произошедших после той даты, до которой были обучены модели. В тестировании принимали участие 6 передовых ИИ-систем, включая GPT-5.4, Claude S4.5 и DeepSeek R1. Их оценивали по четырем параметрам: возможность предсказать, произойдёт ли открытие к конкретному сроку; выбор правильного механизма, который приведёт к результату; разработка стратегии решения научной проблемы; предсказание даты появления достижения.

Основной вывод исследования заключается в разрыве между пониманием научных механизмов и реальным прогнозированием.

В задачах выбора механизма модели значительно превосходили случайный уровень: GPT-5.4 достиг точности 79,2%, а Claude S4.5 — 69,9%. Однако при оценке того, реализуется ли конкретное достижение, результаты оказались близки к случайному угадыванию: GPT-5.4 показал 49,1%, а Claude S4.5 — 52,6%. Модели могли описать правдоподобный путь к открытию, но часто не были в состоянии определить, какой путь действительно приведёт к результату.

Изображение сгенерировано: Nano Banana

ИИ также систематически допускал ошибки с временными рамками. Модели чаще предсказывали появление научных достижений позже, чем они становились общедоступными. Ошибка прогнозирования дат варьировала от 4,9 месяцев у LLaMA 3.3 до 15,7 месяцев у DeepSeek R1, а у некоторых моделей предыдущего поколения превышала 2 года.

Дополнительные знания не решили данной проблемы. Когда моделям предоставляли доступ к информации через ограниченный по времени веб-поиск, результаты улучшались, если причина ошибки заключалась в недостатке данных. Тем не менее, даже при наличии всей доступной информации сохранялся разрыв между знанием фактов и способностью предсказывать. В сравнении с ИИ люди-эксперты продемонстрировали более высокую точность: 73% против 52,5% у GPT-4o в оценке осуществимости научных событий.

Авторы отмечают, что современные ИИ-модели обладают значительной ретроспективной научной компетентностью — они способны анализировать существующие знания и формулировать научно правдоподобные идеи. Однако прогнозирование будущих открытий остаётся отдельной задачей, требующей отдельной оценки. Это важно учитывать при использовании ИИ для выбора направлений исследований, распределения финансирования и принятия научных решений.

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка