Может ли ИИ самостоятельно заниматься исследованиями?
👀 Может ли ИИ самостоятельно заниматься исследованиями? Спойлер: пока нет!
В то время как Anthropic и OpenAI хвастаются способностью своих моделей ускорять исследования, новое исследование от Принстона и UK AI Security Institute ставит под сомнение эти громкие заявления. В ходе эксперимента использовали не опубликованные статьи конференции NeurIPS, чтобы проверить, насколько автономные ИИ могут справляться с реальными задачами. Оказалось, что современные модели отлично справляются с технической частью, но не могут заменить исследователей в том, что действительно важно.
Исследователи применили метод под названием "Shadow Evaluation", где ИИ-агенты решали задачи из ещё неопубликованных научных работ. Результаты оценивали оригинальные авторы как рецензенты конференции. И хотя агентам выделили шесть дней и $3,000 на API, их работы получили "Strong Reject". Авторы критиковали слабую мотивацию экспериментов, нечитабельный текст и отсутствие новых вкладов в науку.
◾️ Модель: Claude Opus 4.8 с Extra-High Reasoning
◾️ Время: 6 дней
◾️ Бюджет: $3,000 на API
◾️ Среда: виртуальная машина с открытым доступом к вебу
> "Агенты генерировали правдоподобные гипотезы, но отвергали их на основе небольших, тщательно отобранных или синтетических наборов данных."
На данный момент, похоже, ИИ ещё не готов заменить живых исследователей. А вы бы доверили роботу написать вашу дипломную работу?
Подписаться на «Нейро Пульс»
Первоисточник ↗
В то время как Anthropic и OpenAI хвастаются способностью своих моделей ускорять исследования, новое исследование от Принстона и UK AI Security Institute ставит под сомнение эти громкие заявления. В ходе эксперимента использовали не опубликованные статьи конференции NeurIPS, чтобы проверить, насколько автономные ИИ могут справляться с реальными задачами. Оказалось, что современные модели отлично справляются с технической частью, но не могут заменить исследователей в том, что действительно важно.
Исследователи применили метод под названием "Shadow Evaluation", где ИИ-агенты решали задачи из ещё неопубликованных научных работ. Результаты оценивали оригинальные авторы как рецензенты конференции. И хотя агентам выделили шесть дней и $3,000 на API, их работы получили "Strong Reject". Авторы критиковали слабую мотивацию экспериментов, нечитабельный текст и отсутствие новых вкладов в науку.
◾️ Модель: Claude Opus 4.8 с Extra-High Reasoning
◾️ Время: 6 дней
◾️ Бюджет: $3,000 на API
◾️ Среда: виртуальная машина с открытым доступом к вебу
> "Агенты генерировали правдоподобные гипотезы, но отвергали их на основе небольших, тщательно отобранных или синтетических наборов данных."
На данный момент, похоже, ИИ ещё не готов заменить живых исследователей. А вы бы доверили роботу написать вашу дипломную работу?
Пока нет комментариев — будьте первым.