Сегодня 30 апреля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → экзамен

OpenAI Deep Research показал рекордный результат в сложнейшем «Последнем экзамене человечества»

Менее двух недель назад эксперты в области искусственного интеллекта представили крайне сложный тест Humanity's Last Exam, предназначенный для оценки передовых нейросетей. Список лидеров в этом испытании возглавили два проекта OpenAI: o3-mini и Deep Research.

 Источник изображения: scale.com

Источник изображения: scale.com

Бенчмарк, созданный экспертами со всего мира, содержит крайне сложные вопросы и задания на знания и рассуждения — даже некоторые люди не могут понять отдельные вопросы в нём, не говоря уже о том, чтобы дать на них ответ. Вскоре после своего выхода список лидеров на экзамене возглавила рассуждающая модель ИИ DeepSeek R1, давшая 9,4 % правильных ответов. Обогнать её смогли модели OpenAI o3-mini с результатом 10,5 % и o3-mini-high, набравшая 13 % — последняя действительно мощнее, но и работает она медленнее. Но более впечатляющим стал результат, который показал ИИ-агент OpenAI Deep Research — он набрал 26,6 %, с ходу побив тем самым предыдущий менее чем за 10 дней.

Сравнение не вполне корректное, потому что Deep Research имеет возможность производить поиск информации, а у традиционных моделей ИИ она отсутствует. И в случае Humanity's Last Exam эта возможность имеет критическое значение, ведь некоторые из вопросов нацелены на проверку знаний. Тем не менее, системы ИИ постоянно улучшают свои результаты, и это заставляет задуматься, когда одна из них сдаст экзамен с высшим баллом. OpenAI Deep Research — чрезвычайно мощный инструмент, предназначенный для работы в качестве персонального аналитика. Он проводит исследования, составляет отчёты и готовит ответы, на которые у человека ушли бы несколько часов.


window-new
Soft
Hard
Тренды 🔥
Reddit заблокировала учёных за тайный эксперимент с ИИ-ботами в дискуссиях 2 ч.
OpenAI откатила обновление ChatGPT из-за подхалимского поведения ИИ 3 ч.
Mozilla Firefox представила долгожданную функцию разделения профилей, как в Chrome 3 ч.
Маск объявил скорый выход Grok 3.5 — размышляющего ИИ, который будет «создавать ответы с нуля» без интернета 9 ч.
Московский суд оштрафовал Blizzard на 600 тысяч рублей за нарушение правил работы в России 9 ч.
Electronic Arts отменила эвакуационный шутер по Titanfall и устроила новую волну сокращений в Respawn 10 ч.
Meta похвасталась, что число загрузок ИИ-моделей Llama перевалило за 1,2 млрд 10 ч.
ИИ-блокнот Google NotebookLM заговорил на русском и ещё более чем 50 языках 11 ч.
Амбициозная российская стратегия Broken Arrow о противостоянии России и США получила дату выхода — в Steam открыт предзаказ 11 ч.
Meta запустила самостоятельное ИИ-приложение для конкуренции с ChatGPT и другими ИИ-ботами 12 ч.
Ракета Firefly Alpha не смогла вывести спутник Lockheed Martin на орбиту — полезная нагрузка упала в океан 19 мин.
Прибыль Samsung в полупроводниковом секторе упала на 42 % из-за санкций и низких цен 2 ч.
TSMC приступила к строительству третьего предприятия в штате Аризона 3 ч.
Новая статья: Гид по выбору складного смартфона в 2025 году 8 ч.
Intel анонсировала техпроцесс 14A с «турбо-ячейкми» и 18A-PT с 3D-штабелированием 9 ч.
Inventec вложит до $85 млн в производство серверов в Техасе 10 ч.
Европейская ракета Vega-C вывела в космос научный спутник ESA Biomass для подсчёта лесов на планете 10 ч.
SilverStone выпустила блок питания мощностью 2500 Вт, которых хватит на трио RTX 5090 или квартет RTX 5080 10 ч.
Одних лишь фабрик чипов недостаточно: на создание полноценной цепочки поставок в США у TSMC уйдёт до 10 лет 13 ч.
Вышло новое устройство на российской ОС «РОСА Мобайл» — планшет «Р-Таб» с чипом Helio G99 14 ч.