Gemini 3.5 Transcribe 받아쓰기 AI 출시
구글의 새 음성 인식 AI 모델 Gemini 3.5 Transcribe는 사전 녹음 단어 오류율 2.6%에 85개 이상 언어를 지원하며 공개 프리뷰로 출시됐습니다.
13개의 기사
구글의 새 음성 인식 AI 모델 Gemini 3.5 Transcribe는 사전 녹음 단어 오류율 2.6%에 85개 이상 언어를 지원하며 공개 프리뷰로 출시됐습니다.
어도비 파이어플라이 오디오 도구가 베타를 끝내고 정식 출시됐습니다. 음악·음성·사운드 효과 생성기 3종에 무료 티어가 붙었지만, 일레븐랩스 음성은 법적 보상 대상에서 빠집니다.
LALAL.AI는 v6 Andromeda로 11가지 스템 분리, 연간 결제 시 월 €6.75. Vocal Remover는 가입 없이 무료입니다. 품질과 가격, 용도별 선택 기준을 정리했습니다.
ElevenCreative는 매달 무료 크레딧 10,000개, 유료는 $6~$99입니다. Studio, Flows, Music v2, Dubbing v2를 리뷰하고 크레딧 소진 지점을 짚습니다.
ElevenLabs가 하루 7곡 무료 생성이 가능한 iOS 앱 ElevenMusic을 출시했습니다. Pro는 월 $9.99에 월 500트랙. Suno·Udio와 경쟁하는 AI 작곡 앱입니다.
Picsart가 Sora 2, Kling 3.0, ElevenLabs 등 24개 업체의 90개 이상 AI 모델을 통합한 AI Playground를 출시했다. 구독 대신 크레딧 결제 방식.
ElevenLabs가 Google Cloud 파트너십을 확대하며 NVIDIA Blackwell GPU, 음성 에이전트용 Gemini 연동, Veo 기반 동기화 비디오·오디오 제작을 지원합니다.
쿠아이쇼우가 Kling AI 3.0을 출시했다. 5개국어 네이티브 오디오, 멀티샷 스토리보딩, AI 디렉터 모드를 지원하며, 4가지 신규 모델로 15초 영화급 AI 동영상 생성을 제공한다.
클링 AI 3.0은 영상과 오디오를 한 번에 생성합니다. 무료 플랜은 매달 66 크레딧, 유료 플랜은 첫 달 $6.99 이후 월 $8.80(연간 결제 시 월 $6.60)입니다.
ElevenLabs가 Liza Minnelli, Art Garfunkel 등 그래미 수상 아티스트들과 함께 만든 AI 음악 앨범을 발표했다. Eleven Music 플랫폼으로 제작.
ElevenLabs가 Scribe v2를 출시했다. 150ms 지연의 Realtime과 48명 화자 구분이 가능한 Batch, 두 가지 특화 STT 모델이다.
음성 AI가 서투른 로봇에서 스마트 에이전트로 변화하고 있습니다. 66억 달러의 VC 투자와 OpenAI의 소문난 오디오 장치로, AI의 미래는 보이는 것만큼 들리는 것일 수 있습니다.
LALAL.AI는 AI로 보컬, 드럼, 베이스 등 8개 이상의 스템을 분리합니다. 무료 10분 미리보기, 유료 플랜은 월 €6.75부터. 전체 리뷰에서 성능을 확인하세요.