구글, 음성 AI 실용성 극대화…'제미나이 3.5 트랜스크라이브' 공개
구글이 실시간 음성 인식 및 지능형 상호작용에 특화된 AI 모델 '제미나이 3.5 트랜스크라이브'를 공개했다.
이 모델은 소음, 전문용어 환경에서도 정확도를 높이고 사용자의 말실수 및 자기 수정까지 이해하여 자연스러운 텍스트로 변환한다.
구글은 이를 통해 회의록 작성, 고객 상담 등 다양한 분야에서 업무 효율성을 높이고 음성 AI 시장의 실용성을 한 단계 끌어올릴 계획이다.
구글이 실시간 음성 인식 및 지능형 음성 상호작용에 특화된 새로운 인공지능(AI) 모델 '제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)'를 26일(현지시간) 공개했다고 밝혔다. 이 모델은 음성 기반 AI의 실용성을 한 단계 끌어올릴 것이라는 평가를 받고 있으며, 특히 소음이 많거나 전문 용어가 섞인 복잡한 환경에서도 정확도를 높이는 데 주력했다. 또한, 사용자의 말실수나 자체 수정, 그리고 대화 중 자연스럽게 나오는 추임새까지 이해하여 자연스럽게 정리된 텍스트로 변환하는 혁신적인 기능을 선보였다.
현재 음성 기반 AI 시장은 스마트 기기, 컨택 센터, 회의록 자동화 등 다양한 분야에서 빠르게 성장하며 활용도가 높아지고 있다. 그러나 소음이 심하거나 전문 용어가 많은 환경, 혹은 사용자의 자연스러운 발화 특성으로 인해 정확도와 실용성 측면에서 한계가 꾸준히 지적돼 왔다. 시장조사기관 가트너에 따르면 글로벌 음성 AI 시장은 2027년까지 연평균 20% 이상 성장할 것으로 전망되는 가운데, 기존 기술의 한계를 극복하는 고도화된 솔루션에 대한 수요가 커지고 있다. 구글의 이번 신규 모델은 이러한 기존 음성 인식 기술의 난제를 해결하며 시장의 실용성을 한 단계 끌어올려 관련 산업 전반에 긍정적인 영향을 미칠 것으로 풀이된다.
실용성 극대화, '자연스러운' 텍스트 변환
구글은 제미나이 3.5 트랜스크라이브를 통해 사용자의 음성 기반 상호작용 경험을 혁신하는 데 집중하고 있다. 이 모델의 핵심 기능은 단순히 음성을 텍스트로 변환하는 수준을 넘어, 사용자의 자연스러운 말투와 문맥을 심층적으로 이해하는 능력에 있다. 특히 대화 중 발생하는 말실수, 스스로 고치는 자기 수정, 그리고 '음...', '아...'와 같은 추임새까지 자동으로 파악하여 이를 제거하거나 적절히 정리해 자연스럽고 가독성 높은 텍스트로 변환해준다. 이러한 기능은 기존 음성 인식 솔루션들이 놓쳤던 미묘한 언어적 뉘앙스를 포착함으로써, 마치 사람이 직접 정리한 것과 같은 높은 완성도의 결과물을 제공하는 것이 특징이다.
구글은 이 기술이 광범위한 AI 생태계 속에서 음성 인터페이스의 핵심 구성 요소로 자리매김하며, 향후 구글의 다양한 서비스와 제품에 통합될 것이라고 설명했다. 이는 구글이 추구하는 '모두를 위한 AI' 비전의 일환으로, 음성 인터페이스의 접근성과 효율성을 한층 더 높이려는 전략으로 해석된다. 사용자들은 더 이상 기술적 제약 때문에 불편함을 겪지 않고, 보다 직관적으로 AI와 소통할 수 있게 될 전망이다.
회의록·고객 상담, 업무 효율성 증대 기대
제미나이 3.5 트랜스크라이브의 가장 큰 차별화 요소는 '높은 인식 정확도'와 '사람처럼 자연스러운 텍스트 변환' 능력에 있다. 이는 특히 복잡하고 소음이 많은 오디오 환경에서 더욱 빛을 발한다. 기존 음성 인식 기술은 배경 소음, 불분명한 발음, 특정 분야의 전문 용어 등으로 인해 오역이 발생하기 쉬웠고, 이는 곧 재작업이나 추가 검토 시간을 유발하는 원인이 되었다. 구글의 새 모델은 이러한 한계를 넘어 탁월한 인식률을 보여주며, 다양한 산업 현장에서의 활용 가능성을 높였다.
구체적인 활용 사례로는 비즈니스 회의록 작성이 꼽힌다. 참석자들의 발화 특성을 정확히 이해하고 정제된 텍스트를 제공함으로써 회의록 작성 시간을 획기적으로 단축할 수 있다. 또한, 고객 상담 센터에서는 상담 내용의 자동 기록 및 분석 정확도를 높여 상담사의 업무 부담을 줄이고 서비스 품질을 향상시키는 데 크게 기여할 것으로 기대된다. 이와 더불어 음성 명령 시스템에서도 사용자의 의도를 보다 정확하게 파악하여 오작동을 줄이고 사용자 만족도를 크게 향상시킬 수 있을 것으로 예상된다. 결과적으로 이번 모델 출시는 다양한 산업 분야에서 업무 효율성을 높이고 디지털 전환을 가속화하는 중요한 전환점이 될 것으로 보인다.
구글 관계자는
※ 투자 조언이 아니라 시나리오 추정입니다. 실제 시장 반응과 다를 수 있습니다.
#구글#Gemini 3.5 Transcribe#음성 AI#음성 인식#Google AI
출처: AI타임스 · 이 기사는 테크노트 기자가 원문 보도를 참고해 재구성했습니다.
관련뉴스
- CDPR, '위쳐 4' 2028년 출시 목표… 야심 찬 비전 제시
- iOS 27의 새로운 '시리 앱', AI 비서 전략 전환 예고
- 세일즈포스, CRM 기능을 '클로드' 안으로 통합한 새 제품 공개
- GTA 6, 차량 절도 시스템 현실성 강화…난이도 차별화
- SKT, AIDC 전담사 'SK호라이즌' 출범…아시아 AI 인프라 허브 공략
- 삼성, '마이 팬캠'으로 개인 영상 촬영 경험 혁신 예고
- LG CNS·네이버클라우드, 삼송 데이터센터에 직접 칩 액체냉각 도입
- 구글, 'Gemini 3.5' 계열로 자동 잡음 제거·전문용어 인식 강화한 음성 전사 공개
AI 영상 ›
WANTED RELOADED | Sci-Fi Western Short Film
WANTED RELOADED | Chapter Two | Sci-Fi Western Short Film
ALVAR — The Unseen | Chapter Three: PIKK #ByLoA
ALVAR — The Unseen | Leave It | Official Music Video — #ByLoA
BONE THRONE | AI Short Film Made with Seedance 2.0 & Kling 3.0
와.. 이건 그냥 영화다... 2026년 AI 근황…선 넘었다
댓글목록
등록된 댓글이 없습니다.