Организация METR, занимающаяся оценкой ИИ-моделей, опубликовала результаты тестирования Claude Opus 4.5. Эта модель от Anthropic продемонстрировала 50%-горизонт продолжительностью 4 часа 49 минут, что стало рекордом среди всех протестированных систем. Это значение указывает на то, что Opus 4.5 может справляться с задачами, требующими такого времени, с вероятностью 50%. Ранее лидировавшая модель GPT-5.1-Codex-Max от OpenAI показала результат в 2 часа 53 минуты.
Важно отметить, что METR измеряет не точность ответов, а время, в течение которого ИИ может автономно выполнять задачи. По данным организации, этот показатель удваивается каждые 7 месяцев. Тем не менее, исследователи предупреждают о необходимости осторожности в интерпретации результатов: доверительный интервал для Opus 4.5 варьируется от 1 часа 49 минут до 20 часов 25 минут. При более высоком пороге успеха в 80% 50%-горизонт падает до 27 минут, что сравнимо с другими современными моделями. Если тенденция удвоения продолжится, то к концу десятилетия ИИ-агенты могут выполнять задачи длительностью в месяц, однако критики указывают на ограничения методологии METR.


