четверг, 1 октября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 26 августа 2026 г. в 20:38

Google представила новую модель Gemini, превращающую бессвязную речь в структурированный текст

Google представила Gemini 3.5 Transcribe — новую аудиомодель, которая преобразует неупорядоченную речь в оформленный текст и вскоре появится в любом текстовом поле браузера Chrome. Модель распознаёт более 85 языков и может различать до трёх говорящих.

Foto: Engadget

Google анонсировала новую аудиомодель искусственного интеллекта Gemini 3.5 Transcribe, которая пополнила семейство Gemini Audio наряду с Gemini 3.5 Live и Gemini 3.5 Live Experimental. Компания утверждает, что новая модель обеспечивает более точное распознавание речи по сравнению с предыдущими версиями и способна автоматически определять более 85 языков.

Одна из ключевых особенностей модели — способность превращать несвязную, естественную речь пользователя в аккуратный, оформленный текст. Система умеет обрабатывать самоисправления говорящего, убирать слова-паразиты и сохранять исходный смысл сказанного. Редактировать полученный текст можно и с помощью голосовых команд.

Дополнительные возможности

По словам Google, Gemini 3.5 Transcribe способна запоминать индивидуальный словарный запас пользователя и нестандартные варианты написания слов, а также точно распознавать буквенно-цифровые последовательности, например номера заказов или почтовые индексы. Модель также может различать до трёх разных говорящих с временными метками на уровне отдельных слов при работе с заранее записанным аудио — это может пригодиться, например, при расшифровке подкастов.

Новая модель уже используется в функции Rambler на устройствах Android, включая смартфоны линейки Pixel 11, а также в приложении Gemini для macOS, где она может работать совместно с другими моделями Gemini для выполнения более сложных агентных задач.

Google также сообщила, что в скором времени преобразование речи в текст станет доступным в любом поле на веб-странице через браузер Chrome — пользователи смогут надиктовывать ответы и посты или отдавать голосовые команды Gemini. Модель уже доступна на платформе для разработчиков Google Antigravity и в ближайшее время появится в Search Live, Gemini Live, а также в Docs, Keep и Gmail. Разработчики смогут получить доступ к модели через API.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Обзор Tractive Cat 6 Mini: умный ошейник следит за пульсом кошки

Новый умный ошейник Tractive Cat 6 Mini научился измерять пульс и частоту дыхания кошек, но его батареи хватает лишь на четыре дня. Устройство также требует подписки и неудобно застёгивается.

Wired · 36 мин назад

Технологии

Apple Mac Studio с чипом M5 Ultra: мощный компьютер для локального AI

Издание Wired протестировало новый Apple Mac Studio с чипом M5 Ultra, способный запускать крупные языковые AI-модели полностью офлайн. Устройство получило оценку 9 из 10, а его топовая конфигурация стоит до 11 000 долларов.

Wired · 1 ч назад

Технологии

Huawei создала отдельный камерный модуль с собственным сенсором для нового флагмана

Huawei выпустила Ruiying Z10 — съёмный камерный модуль для Mate 90 Pro Max с собственным сенсором изображения и настоящим зум-объективом. Это превосходит телеконвертеры с фиксированным фокусным расстоянием, которые ранее предлагали другие китайские производители.

The Verge · 1 ч назад