Google представила обновленную модель Gemini 2.5 Flash Native Audio, которая продемонстрировала превосходство над OpenAI gpt-realtime в тестировании сложных функциональных вызовов. Модель уже интегрирована в продукты Google и доступна для разработчиков. На тесте ComplexFuncBench Audio Gemini 2.5 набрала 71,5% по сравнению с 66,5% у конкурента. Также сообщается о 90% точности выполнения инструкций, что является улучшением по сравнению с прежними 84%. Модель лучше справляется с многошаговыми диалогами, эффективно встраивая результаты в разговор. Gemini 2.5 уже используется в голосовом режиме приложений Gemini и Search Live, заменяя традиционную архитектуру «распознавание → LLM → синтез». Первые клиенты, такие как United Wholesale Mortgage, отмечают успешные результаты, включая более 14 000 оформленных кредитов с помощью голосового помощника Mia. Кроме того, Google запустила бета-версию синхронного перевода в Google Translate, поддерживающую более 70 языков и предлагающую различные режимы работы.
Posted on : 14.12.2025 By Redactor
