Google представила свою новую модель голосовых агентов — Gemini 2.5 Flash Native Audio. Эта модель обошла OpenAI gpt-realtime в тестах ComplexFuncBench Audio, набрав 71,5% против 66,5%. Компании удалось достичь 90% точности в выполнении инструкций разработчиков, что значительно выше предыдущего показателя в 84%. Кроме того, улучшено удержание контекста в многоходовых диалогах, а значит, модель лучше понимает, когда нужно вызывать внешние функции и интегрировать результаты в беседу естественным образом.
Gemini 2.5 Flash Native Audio уже используется в голосовом режиме приложений Gemini и Search Live, обеспечивая поиск Google нативным аудио вместо традиционной архитектуры. Разработчикам доступна новая модель через Google AI Studio и Vertex AI, а также в режиме preview через Gemini API. Среди первых клиентов — United Wholesale Mortgage, где голосовой ассистент Mia оформил более 14 000 кредитов с мая 2025 года. Shopify также отметила, что их пользователи забывают, что общаются с ИИ.
В дополнение к обновлению модели, Google запустила бета-версию синхронного перевода в Google Translate, поддерживающего более 70 языков и предлагающего два режима: непрерывное прослушивание и двусторонний разговор. Бета доступна на Android в США, Мексике и Индии, пока на iOS и в других регионах — в 2026 году.


