Gemini 3.5 Transcribe
Gemini 3.5 Transcribe는 복잡한 오디오 환경, 추임새, 다중 화자 식별을 효과적으로 처리하며 정밀한 실시간 전사를 위해 설계된 고성능 음성-텍스트 변환 모델입니다.
Gemini 3.5 Transcribe는 복잡한 오디오 환경, 추임새, 다중 화자 식별을 효과적으로 처리하며 정밀한 실시간 전사를 위해 설계된 고성능 음성-텍스트 변환 모델입니다.
제품의 기능과 공식 포지셔닝
Gemini 3.5 Transcribe는 원시 오디오를 정제되고 형식이 지정된 텍스트로 변환하도록 설계된 지능형 음성-텍스트 변환 모델입니다. 배경 소음, 전문 용어 및 자연스러운 대화 패턴을 효과적으로 관리하도록 제작되었습니다.
이 모델은 실시간 스트리밍 및 사전 녹음된 오디오 처리 API를 통해 개발자를 지원합니다. 다양한 Google 서비스에 통합되어 문맥 인식 전사 및 음성 명령 기능을 제공하며 효율적인 작업 환경을 구축합니다.
공식 출처로 확인된 활용 사례
개발자는 Live API를 사용하여 고성능 음성 에이전트 및 실시간 자막 도구를 구축할 수 있습니다.
조직은 녹음된 회의 및 통화 기록을 처리하여 화자 식별 및 타임스탬프가 포함된 전사본을 생성합니다.
Gemini 3.5 Transcribe는 이전 모델에 비해 지연 시간과 정확도가 크게 향상되었습니다. 사용자의 의도를 깊이 있게 이해하고 맞춤 어휘를 인식하도록 최적화되어 다양한 환경에서 높은 성능을 지원합니다.
본인의 자료와 작업 흐름으로 직접 확인할 항목
확인한 출처와 확인 시점
출처를 확인한 제품 정보를 바탕으로 한 답변
이 모델은 대화형 음성 애플리케이션을 위한 실시간 연속 스트리밍과 회의 및 통화 기록과 같은 사전 녹음된 오디오 파일 처리를 모두 지원합니다.
Gemini 3.5 Transcribe는 '음', '아'와 같은 추임새를 자동으로 식별하여 제거하고 자기 수정을 정제하는 스마트 트랜스크립션 기능을 갖추고 있습니다.
예, 이 모델은 사전 녹음된 오디오에서 최대 3명의 화자에 대한 다중 화자 식별 기능을 제공하며, 각 할당에 대해 단어 수준의 타임스탬프를 포함합니다.
이 모델은 글로벌 언어 지원 기능을 갖추고 있어 다양한 지역 억양과 방언을 포함한 85개 이상의 언어를 자동으로 감지하고 전사할 수 있습니다.
개발자는 Google AI Studio의 Gemini API, Gemini Enterprise Agent Platform 및 Google Antigravity를 통해 공개 미리보기 버전으로 모델을 이용할 수 있습니다.