듣기와 말하기를 각각 개선한다

마이크로소프트가 2026년 10월 1일 MAI-Transcribe-2-Streaming과 MAI-Voice-2.1, MAI-Voice-2.1-Flash를 발표했다. 음성을 텍스트로 바꾸는 실시간 전사와, 텍스트를 음성으로 만드는 합성 기능을 각각 겨냥한 모델이다. 공식 발표

회사는 스트리밍 전사 모델이 60개 언어와 연속적인 자동 언어 감지를 지원하고 약 100밀리초 뒤 부분 전사 결과를 내기 시작한다고 설명한다. 부분 결과가 빨리 보이는 것과 문장 전체가 확정되는 시점은 다른 지표다. 이를 모든 발화의 처리 완료 시간으로 해석해서는 안 된다.

음성 파형이 텍스트 카드로 전환되고 다시 음성으로 출력되는 AI 개념도

두 가지 음성 합성 모델

모델 공식 발표에서 강조한 방향
MAI-Transcribe-2-Streaming 대화 도중 텍스트를 내보내는 실시간 전사
MAI-Voice-2.1 다국어 음성 합성과 화자 정체성 유지
MAI-Voice-2.1-Flash 음성 합성의 지연과 비용 절감

음성 합성 모델은 23개 언어와 26개 로케일을 지원한다고 발표됐다. 하나의 voice ID로 언어가 바뀌어도 같은 화자의 특성을 유지하는 방향이다. 빠른 처리와 비교 모델 대비 우위는 마이크로소프트의 발표 내용이며, 본 기사의 독립적인 성능 시험 결과는 아니다.

제품 문서는 공개 프리뷰로 안내

Microsoft Learn의 전사·음성 문서는 확인 시점에 Public Preview로 안내하고 SLA가 없다는 조건을 명시한다. 발표에서 이용 경로가 소개됐더라도 이를 곧바로 정식 운영 서비스와 같은 조건으로 볼 수는 없다. 전사 문서, 음성 문서

서비스에 연결하려면 모델의 지연 시간뿐 아니라 오디오 입력부터 결과를 사용자에게 전달하기까지의 전체 경로를 봐야 한다. 네트워크와 버퍼링, 화면 갱신까지 포함하면 체감 속도는 모델 단독 수치와 달라질 수 있다. 이는 편집팀이 제안하는 평가 관점이다.

실제 업무에서는 무엇을 시험하나

가상의 회의 자막 도구라면 사람 이름과 제품명, 말이 겹치는 구간, 언어가 섞인 발화를 따로 준비할 수 있다. 자막이 빨리 나타나는지와 최종 문장이 정확한지를 각각 기록해야 한다.

음성 안내 시스템이라면 숫자와 단위, 고유명사 발음, 문장 사이의 자연스러운 연결을 확인할 수 있다. 빠른 생성만으로 안내가 이해하기 쉬운지까지 판단하기는 어렵다.

자주 묻는 질문

전사와 음성 합성은 무엇이 다른가?

전사는 음성을 글로 바꾸고, 합성은 글을 소리로 바꾼다. 같은 음성 AI여도 서비스에서 담당하는 단계가 다르다.

100밀리초면 전체 자막이 완성되나?

아니다. 발표는 부분 전사 결과가 나타나기 시작하는 시점을 설명한다. 확정 결과와 구분해야 한다.

기존 MAI-Transcribe-2와 같은 모델인가?

이번 발표의 대상은 이름에 Streaming이 붙은 변형이다. 기존 모델의 사양과 제공 조건을 그대로 적용해서는 안 된다.

바로 운영 서비스의 핵심 경로에 넣어도 되나?

프리뷰 조건과 장애 시 대체 경로를 먼저 검토할 필요가 있다. 대표 발화로 품질을 확인한 뒤 적용 범위를 정할 수 있다.

한눈에 정리

새 MAI 모델은 실시간 전사와 다국어 음성 합성을 각각 개선하려는 발표다. 도입 판단에는 부분·최종 결과의 차이, 실제 발화 품질, 공개 프리뷰의 운영 조건을 함께 놓아야 한다.