Лех Мазур, исследователь в области искусственного интеллекта, запустил LLM Persuasion Benchmark — уникальный бенчмарк, в котором 15 языковых моделей ведут дебаты по различным вопросам, стремясь изменить мнения друг друга. В ходе эксперимента было проведено 6300 многораундовых диалогов, где каждая модель занимала обе стороны 15 утверждений, включая такие темы, как ограничения на движение автомобилей в центре городов и экспериментирование с эмбрионами. Суть бенчмарка заключается в том, что одна модель получает заданный спорный тезис и, используя 8 реплик, пытается убедить другую модель. Эффективность аргументации оценивается по шкале от -3 до +3. Лидером по уровню убеждения стала модель GPT-5.4, набравшая 1,71 балла. За ней следуют Claude Opus 4.6 (1,67) и ByteDance Seed2.0 Pro (1,64). Интересно, что модели лучше справляются с опровержением аргументов, чем с их защитой. Также был составлен отдельный рейтинг по устойчивости моделей, где Grok 4.20 Beta оказался практически неуязвимым. Данный бенчмарк раскрывает возможности языковых моделей, показывая, что красноречие не всегда гарантирует убедительность.
Самосвальные полуприцепы: техника для стройки и добычи инертных материалов
Строительные площадки, карьеры и дорожные работы формируют один из самых требовательных сегментов рынка грузовой техники — здесь полуприцепы работают в жёстких условиях: бездорожье, абразивные материалы, интенсивная эксплуатация и частые циклы…

