text-to-video텍스트 투 비디오
text-to-video는 글로 입력한 장면 설명을 바탕으로 AI가 영상을 생성하는 방식이다.
기사 1편
최근 언급 text-to-video는 장면, 동작, 분위기 등을 설명하는 글을 입력받아 영상을 생성하는 AI 방식이다. 기존 이미지를 출발점으로 삼는 image-to-video(이미지를 영상으로 변환하는 방식)와 달리, 생성의 주된 입력이 텍스트다.
주로 확산 모델을 바탕으로 발전했으며, 2024년 OpenAI가 Sora를 공개한 뒤 널리 주목받았다. Google의 Veo, Runway의 Gen 계열 모델 등이 대표적이며, 광고·숏폼 영상 제작 등에 쓰인다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.