Организация METR огласила итоги оценки модели Claude Opus 4.6 по бенчмарку Time Horizon 1.1, который旨ет сложность задач для ИИ-агентов. Новая модель Anthropic продемонстрировала 50%-й временной горизонт около 14,5 часов, что означает, что она справляется с задачами, на которые у человека-эксперта ушло бы столько же времени с вероятностью успеха 50%. Ранее рекорд принадлежал GPT-5.2 (high) с результатом 6 часов 34 минуты. Тем не менее, исследователи подчеркивают, что эта цифра не должна восприниматься буквально, так как 95%-й доверительный интервал варьируется от 6 до 98 часов, верхняя граница превышает любую задачу в тестовом наборе. Новый набор задач был обновлен, но растущие способности моделей делают его актуальность сомнительной. Данные METR указывают на удвоение горизонта каждые ~4 месяца, что значительно ускоряет прогресс. MIT Technology Review описал график METR как «самый неправильно понимаемый график в ИИ», подчеркивая, что 14,5 часов не означают непрерывной работы Opus, а отражают способность решения задач, которые были бы трудны для человека.
Самосвальные полуприцепы: техника для стройки и добычи инертных материалов
Строительные площадки, карьеры и дорожные работы формируют один из самых требовательных сегментов рынка грузовой техники — здесь полуприцепы работают в жёстких условиях: бездорожье, абразивные материалы, интенсивная эксплуатация и частые циклы…

