speech-to-text음성 인식

speech-to-text는 사람의 말소리를 글자로 바꾸는 기술로, 자동 음성 인식이라고도 한다.

기사 1편
최근 언급

speech-to-text는 녹음되거나 실시간으로 들어오는 음성을 분석해 글로 옮기는 기술이다. 자동 음성 인식(ASR)이라고도 부르며, 글을 음성으로 바꾸는 text-to-speech와 반대 방향의 기술이다.

대량의 음성과 받아쓰기 자료로 학습한 신경망 모델이 주로 쓰인다. 회의록 작성, 자막 생성, 음성 비서, 음성 명령 같은 곳에 쓰이고, 낱말마다 시간 정보를 함께 내놓는 모델도 있다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

키를 누른 채 말하면 speech-to-text(음성을 글로 바꾸는 기술)로 명령을 글로 바꾸고, Decisions API가 앱 열기·끄기, 앱 전환, 브라우저 탭 이동 같은 행동 목록에서 하나를 고릅니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.