전체 글
음성 AI 2분 읽기

화자 분리는 어떻게 작동하고, 어디서 어긋나는가

누가 말하는지에 따라 녹음을 나누는 일은, 무엇을 말했는지 받아쓰는 일과 별개의 문제입니다. 모델이 실제로 듣는 것은 무엇일까요.

모델이 실제로 듣는 것

전사 모델은 소리를 단어로 바꿉니다. 화자 분리는 다른 질문에 답합니다. 각 순간에 누가 말하고 있었는가. 시스템은 오디오를 짧은 구간으로 자르고, 각 구간을 목소리의 수치 지문으로 바꾼 뒤, 서로 닮은 지문끼리 묶습니다. 묶음 하나하나가 화자 라벨이 됩니다. 이 과정 어디에도 사람의 이름은 없습니다. 이 목소리가 저 목소리가 아니라는 사실만 알 뿐입니다.

어디서 어긋나는가

오류의 대부분은 세 가지 상황에서 나옵니다.

  • 겹침. 두 사람이 동시에 말하면 한 구간에 두 목소리가 담기고, 더 닮은 쪽 묶음으로 들어갑니다.
  • 짧은 발화. 한 마디 «네»는 지문을 뜨기에 재료가 너무 적어서, 짧은 맞장구가 가장 먼저 잘못 붙습니다.
  • 비슷한 목소리. 나이와 성별, 억양이 비슷한 두 사람을 같은 마이크로 녹음하면 하나의 라벨로 뭉개질 수 있습니다.

모델보다 녹음 환경이 더 큰 영향을 줍니다. 울림이 있는 방에서 노트북 마이크 하나로 담은 회의는, 참가자마다 채널을 나눠 녹음한 같은 회의보다 훨씬 어려운 문제입니다.

어떻게 할까

나중에 라벨을 고치는 편이 녹음과 씨름하는 것보다 빠릅니다. WhoScribe에서는 화자 이름을 한 번만 바꾸면 그 화자의 모든 줄이 새 이름을 갖습니다.

첫 1분을 꼼꼼히 읽으세요. 인사와 소개 부분에서 라벨이 가장 자주 뒤바뀌며, 여기서 일찍 고치면 나머지 전사본이 올바르게 읽힙니다.

방에 몇 명이 있는지 안다면 알려 주세요. 목소리가 셋이라고 들은 모델은 배경 소음에서 네 번째를 지어내지 않습니다.

블로그

내 녹음을 텍스트로 바꾸기

파일을 올리면 몇 분 안에 전사본을 읽을 수 있습니다. 가입은 필요 없습니다.

파일을 텍스트로 변환