Исследователи из Goodfire AI и Гарварда провели анализ reasoning-моделей, включая DeepSeek-R1 (671B) и GPT-OSS (120B), и сделали интересные выводы. Оказалось, что модели часто занимаются «театральным рассуждением»: они уверены в ответе на 90%, но продолжают генерировать рассуждения, как будто еще размышляют. Методом проб, основанным на активациях, они смогли фиксировать ответы моделей задолго до их появления в текстах. Используя три подхода — attention-пробы, принудительный обрыв рассуждения и сторонний CoT-монитор — исследователи выявили, что на простых вопросах из MMLU модели «знали» решения заранее. В более сложных задачах из GPQA-Diamond уверенность возрастала вместе с процессом генерирования. Также отмечено, что «переломы» в рассуждениях происходят только при реальной неуверенности модели. Результаты могут быть полезны для оптимизации генерации ответов, экономя до 80% токенов без потери точности. DeepSeek-R1 и GPT-OSS, как выяснилось, отстали от новых технологий, и возможно, разработчики уже устранили избыток расходов токенов.
Самосвальные полуприцепы: техника для стройки и добычи инертных материалов
Строительные площадки, карьеры и дорожные работы формируют один из самых требовательных сегментов рынка грузовой техники — здесь полуприцепы работают в жёстких условиях: бездорожье, абразивные материалы, интенсивная эксплуатация и частые циклы…

