Система MedASR, обладающая 105 миллионами параметров, была создана для точной расшифровки медицинских диктовок и клинических разговоров. Она обучена на 5000 часах обезличенной медицинской речи, включая врачебные записи и диалоги с пациентами. Модель использует архитектуру Conformer и ориентирована на специфические медицинские термины, что делает её более эффективной в сравнении с универсальными решениями.

MedASR принимает моноаудио в формате 16 кГц и предоставляет текстовую расшифровку без интерпретации смысла. Это создаёт фундамент для дальнейших голосовых приложений в здравоохранении, таких как расшифровка радиологических заключений и автоматизация заполнения клинических заметок.

Разработчики также подчеркивают возможность дообучения системы для специфических задач, улучшения распознавания и расширения словаря. Для анализа содержания текста можно использовать генеративные модели, что позволяет создавать резюме и отвечать на вопросы по расшифровке. Это открывает новые перспективы для автоматизации в медицине.