플랫폼 이관

녹취 이관 검수 보고서: 원본 DB와 건별 대조

전부 변환했다는 말은 검증할 수 없고 내부감사나 규제 기관에 낼 수도 없습니다. 검수가 답해야 하는 것은 원래 몇 건이고, 몇 건이 왔고, 몇 건이 빠졌으며, 빠진 것이 어느 건인가입니다. 기준 산정, 누락의 시기 분포, 원인 분류, 보고서 구성을 정리합니다.

업데이트

변환 완료는 검수 기준이 아니다. 검증 가능함이 기준이다

이관 프로젝트를 마무리할 때 가장 흔한 납품 표현은 전부 변환이 끝났다는 말입니다. 이 문장은 검증할 수 없고 내부감사나 규제 기관에 낼 수도 없습니다. 원래 몇 건이 있어야 했는지, 실제로 몇 건이 도착했는지, 몇 건이 빠졌는지, 빠진 것이 어느 건인지 아무것도 말해 주지 않기 때문입니다. 검증할 수 있는 형태는 하나뿐입니다. 원 플랫폼 데이터베이스의 레코드를 기준으로 총건수, 성공 건수, 누락 건수를 제시하고, 누락된 한 건 한 건이 구체적으로 어느 통화인지 특정되게 하는 것입니다. 앞의 것은 결론이고 뒤의 것은 제삼자가 직접 다시 계산할 수 있는 보고서입니다. 검수의 의미는 공급업체를 믿는 데 있지 않고, 같은 데이터를 든 누구라도 같은 숫자에 도달하는 데 있습니다.

기준은 원본 데이터베이스의 건수이지 산출 폴더의 파일 수가 아니다

성공률의 분모가 그 보고서에 의미가 있는지를 결정합니다. 내보낸 디렉터리의 파일 수를 분모로 삼으면 성공률은 언제나 백 퍼센트에 가깝게 나옵니다. 꺼내지 못한 통화는 애초에 분모에 들어 있지 않아 누락이 스스로를 숨기기 때문입니다. 올바른 분모는 원 플랫폼 데이터베이스에서 대상 범위에 해당하는 통화 레코드 건수입니다. 먼저 기간과 업무 범위로 대상을 확정하고, 그 범위의 레코드 총수를 세고, 내보내기에 착수하기 전에 그 숫자를 양측이 서면으로 확인합니다. 이후 성공률은 사용 가능한 음성 건수를 이 기준으로 나눈 값이고, 누락률은 그 차이를 같은 기준으로 나눈 값입니다. 사용 가능이라는 말에도 정의가 필요합니다. 디코딩이 되고, 길이가 레코드와 일치하고, 원본 데이터베이스의 기본키로 되짚어 특정할 수 있을 것. 세 가지가 모두 충족되어야 성공으로 셉니다.

누락의 시기 분포가 누락 총수보다 쓸모 있다

누락 0.8% 라고만 적힌 보고서는 아무것도 적지 않은 것과 같습니다. 같은 0.8% 라도 십 년에 걸쳐 고르게 흩어져 있다면 개별 파일이나 매체의 우발적 손상일 가능성이 높습니다. 특정한 석 달에 몰려 있다면 그 시기에 시스템 설정, 코덱 버전, 저장 매체 로트 같은 무언가가 바뀌었음을 가리키는 경우가 많습니다. 매일 같은 시간대에 몰려 있다면 당시의 아카이브 작업이 통화 피크와 부딪혔다고 보는 편이 자연스럽습니다. 그래서 누락 목록은 월별, 주별, 시간대별로 각각 분포를 뽑아야 하고, 그러면 근본 원인이 스스로 떠오르는 경우가 많습니다. 총수는 문제가 있는지만 알려 줍니다. 문제가 어디에 있는지, 그리고 남은 누락을 계속 쫓을 가치가 있는지를 알려 주는 것은 분포 쪽입니다.

누락 원인은 나누어 집계한다. 같은 실패가 아니기 때문이다

누락은 하나의 현상이 아니라, 성격이 전혀 다른 여러 현상이 한 숫자에 더해진 결과입니다. 매체 수준의 손상은 테이프나 디스크의 물리적 불량 블록으로, 읽기 오류나 원래보다 짧게 돌아오는 데이터로 나타납니다. 코덱 수준의 이상은 파일은 읽히는데 디코딩이 실패하거나 풀린 결과가 잡음인 경우로, 당시 사용하던 비표준 인코딩 파라미터나 독자 변형에서 비롯되는 일이 많습니다. 그리고 가장 자주 간과되는 유형은 원본 레코드 자체가 비어 있는 경우입니다. 통화는 성립했고 레코드도 기록되었지만 당시에 아예 녹음되지 않았거나, 오래전 어떤 시스템 작업에서 음성이 이미 사라진 것입니다. 이 마지막 무리는 이번 이관이 만든 것이 아니므로 반드시 따로 표시해야 합니다. 그러지 않으면 이관 측의 실패로 계산되고, 실제로 고칠 수 있는 문제가 그 안에 묻힙니다.

무작위 추출, 시기별 층화 추출, 상담원별 추출은 다른 질문에 답한다

대조가 증명하는 것은 건수가 맞는다는 사실뿐이고, 내용이 옳다는 것은 증명하지 못합니다. 그 층을 메우는 것이 표본 점검입니다. 순수한 무작위 추출은 전체 품질에 대한 치우치지 않은 추정을 주므로 보고서의 결론부에 적합하지만, 표본은 데이터가 많은 몇 해에 자연히 몰리고 가장 오래된 자료는 한 건도 뽑히지 않을 수 있습니다. 시기로 층화한 추출은 매년, 매 매체 로트에서 반드시 뽑도록 강제하는 방식으로, 특정 기간에만 닫혀 있는 계통적 문제를 찾기 위해 존재합니다. 상담원별이나 내선별 추출은 녹취 채널에 묶인 문제, 예컨대 처음부터 일부 채널만 모노였거나 레벨이 비정상이었던 사례를 잡아냅니다. 세 방법은 각기 다른 사각지대를 가지므로 정식 검수에서는 셋을 모두 수행하고, 결과는 하나의 합격률로 합치지 않고 나누어 기록합니다.

제출할 수 있는 검수 보고서에는 무엇이 들어가는가

  1. 대상 범위의 정의: 기간, 업무 범위, 포함과 제외 규칙, 그리고 그에 따라 원본 데이터베이스에서 센 레코드 총수, 즉 기준. 이 숫자는 내보내기에 착수하기 전에 양측이 서면으로 확인합니다.
  2. 세 개의 핵심 숫자와 산출 방식: 성공 건수, 누락 건수, 성공률. 그리고 성공의 판정 조건(디코딩이 되고, 길이가 레코드와 일치하고, 원본 기본키로 되짚을 수 있음)을 명시합니다.
  3. 건별 누락 목록: 각 건에 원본 기본키, 통화 시각, 실패 원인 분류(매체 손상 / 디코딩 실패 / 원본 레코드 비어 있음 / 기타)를 담아 어떤 건이든 기본키로 다시 조회할 수 있게 합니다.
  4. 누락의 시기 분포: 월별과 시간대별로 각각 한 장씩. 눈에 띄는 집중에는 설명을 붙이고, 원인을 특정하지 못했다면 그 사실을 그대로 적습니다.
  5. 표본 점검 결과: 추출 방식, 표본 수, 통과 건수, 미통과 건수와 구체적인 문제. 무작위와 층화는 합산하지 않고 따로 제시합니다.
  6. 다시 계산할 수 있는 원자료: 원본 데이터베이스를 셀 때 쓴 조회 조건, 산출 목록, 검증 스크립트의 출력. 받는 쪽이 이것만 가지고 공급업체 없이도 같은 숫자에 도달할 수 있어야 합니다.

상하이 완춘의 방식

저희는 콜센터 과거 녹취의 파싱과 이관을 수행하며, 검증 보고서는 음성 및 메타데이터와 나란히 놓이는 납품물이지 프로젝트 말미에 덧붙이는 설명서가 아닙니다. 기준은 착수 전에 확인하고, 성공과 누락의 판정 조건은 나중에 설명하는 대신 문서에 적고, 누락은 건별로 나열해 원인으로 분류하고, 시기 분포와 표본 점검 결과를 함께 제출하며, 모든 숫자에는 다시 계산할 수 있는 원자료를 붙입니다. 목표는 그대로 내부감사나 규제 기관 앞에 내놓을 수 있는 보고서입니다. 이관이 끝났음을 믿어 달라고 하는 것이 아니라, 상대가 스스로 검증할 수 있게 하는 것입니다.

관련 문서