SCI-VOC v215 · 12번 TO-BE 이후 화자분리 중심 신규 학회지 한글 원고

7. 실제 화자분리 상세보고서

전체 통합 문서에 동일하게 포함되는 논문용 상세보고서입니다.

7. 실제 화자분리 상세보고서

논문 작성용 상세 본문

pyannote 기반 화자분리를 TO-BE 1,000개 통화에 적용해 SPEAKER 세그먼트 57,619건을 생성했다.

각 세그먼트는 call_id, speaker_label, start_sec, end_sec, duration_sec 등의 키를 가지며, 후속 feature/STT/stress 병합의 기준 행으로 사용된다.

화자분리 성공은 음성 구간과 화자 후보가 분리됐다는 의미이며, 고객과 상담사의 실제 역할이 확정됐다는 의미는 아니다.

화자분리는 통화 전체 음성을 시간 구간과 화자 후보 라벨로 분할하는 단계이다. 결과는 57,619개 세그먼트이며 각 행은 통화, 화자 후보, 시작·종료 시각, 구간 길이 정보를 가진다.

세그먼트는 후속 acoustic feature, STT, WPM, stress_score를 연결하는 최소 분석 단위이다.

SPEAKER_00과 SPEAKER_01은 상대적 클러스터 라벨이므로 실제 고객 또는 상담사 역할로 확정해서는 안 된다.

분석 수치 및 결과표

표 7-1. 화자분리 결과 요약

항목상태
입력 통화1,000완료
SPEAKER 세그먼트57,619완료
통화-화자 슬롯2,000완료
상태 코드DONE_SPEAKER_DIARIZATION완료

표 7-2. 세그먼트 진단 필드

필드설명
file원본 통화 파일
duration_sec통화 길이
sample_rate샘플레이트
channels채널 수
speaker_count검출 화자 수
segment_count세그먼트 수
status/error실제 오류 여부

표 7-Q. 연구 질문

번호연구 질문
11,000개 통화에서 실제 화자 세그먼트를 안정적으로 생성했는가?
2화자분리 결과가 후속 병합의 기준 키로 활용 가능한가?

표 7-M. 분석 방법 및 도구

순서방법/도구
1pyannote diarization
2Two-speaker constraint
3Segment diagnostics
4Truth-gate verification

분석 그림 및 도식

그림 7-1. 실제 화자분리 결과 규모
그림 7-1. 실제 화자분리 결과 규모
그림 7-2. 통화에서 세그먼트까지의 처리 흐름
그림 7-2. 통화에서 세그먼트까지의 처리 흐름
그림 7-3. 후속 병합 기준키
그림 7-3. 후속 병합 기준키

원본 분석 산출물 연계

산출물 CSV: research_continuity/17_speaker_diarization_v171/speaker_diarization_segments_v171.csv (행 0, 열 1)

전체 행 포함
message

산출물 CSV: research_continuity/20_speaker_oneclick_addon_v173/speaker_diarization_segments_v173_from_v171.csv (행 0, 열 1)

전체 행 포함
message

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_acoustic_feature_candidates_v176.csv (행 0, 열 2)

전체 행 포함
itemvalue

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_actual_segments_v176.csv (행 0, 열 9)

전체 행 포함
file_idaudio_pathsegment_indexspeaker_labelstart_secend_secduration_secsourceactual_diarization

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_interaction_categories_v176.csv (행 7, 열 5)

전체 행 포함
category_nocategorystateanalysis_viewpaper_policy
7-1AI-IS/0413 기준 불러오기DONE기존 stress 산식·0413 본문 기준은 유지본문 유지
7-2TO-BE 음성 입력 확인NEEDS_AUDIO_INPUT입력 음성 0건확장분석 입력
7-3실제 화자분리 실행READY_TO_RUN_ACTUAL_DIARIZATION_NOT_EXECUTED세그먼트 0건 / pyannote=True / token=False가짜 분리 금지
7-4화자별 음성 파일 분리WAITING_FOR_ACTUAL_DIARIZATIONSPEAKER_00/SPEAKER_01 등 화자별 wav를 로컬 생성원음성은 공개 배포 제외
7-5고객/상담원 역할 매핑NEEDS_ROLE_MAPPINGspeaker_role_mapping_template_v176.csv에서 customer/agent 수동 확인역할 검증 전 고객-only 주장 금지
7-6고객 고스트레스 이후 상담원 변화WAITING_FOR_ROLE_MAPPING_AND_SPEAKER_STTagent_reactivity_delta 등 후보 지표부록·후속연구 후보
7-7Word 통합 보고서DONE6번 전체 내용 + 7번 실제 화자분리 상태 포함교수님 검토용

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_interaction_metrics_v176.csv (행 0, 열 2)

전체 행 포함
itemvalue

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_interaction_readiness_v176.csv (행 0, 열 2)

전체 행 포함
itemvalue

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_role_mapping_template_v176.csv (행 1, 열 6)

전체 행 포함
file_idspeaker_labelrolemapping_confidenceevidencememo
실제 화자분리 후 자동 생성

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_split_audio_manifest_v176.csv (행 0, 열 6)

전체 행 포함
file_idspeaker_labelsplit_audio_pathsegment_countstatepublic_deploy

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_tobe_audio_discovery_v179.csv (행 44, 열 5)

전체 행 포함
prioritycandidate_pathexistsaudio_count_foundpolicy
1C:\AI\sci_voc_bot\data\voc\audio_wav_16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
2C:\AI\sci_voc_bot\data\voc\audio_rawFalse0TO-BE/VOC analyzed audio auto-scan candidate
3C:\AI\sci_voc_bot\data\tobe\audio_wav_16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
4C:\AI\sci_voc_bot\data\tobe\audio_rawFalse0TO-BE/VOC analyzed audio auto-scan candidate
5C:\AI\sci_voc_bot\datasets0406\02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
6C:\AI\sci_voc_bot\datasets0413\02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
7C:\AI\sci_voc_bot\datasets0223\02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
8C:\AI\sci_voc_bot\VOC_fullFalse0TO-BE/VOC analyzed audio auto-scan candidate
9C:\AI\sci_voc_bot\VOC_sample1000_2False0TO-BE/VOC analyzed audio auto-scan candidate
10C:\AI\sci_voc_bot\resources\tobe\audioFalse0TO-BE/VOC analyzed audio auto-scan candidate
11C:\AI\sci_voc_bot\resources\tobe\wavFalse0TO-BE/VOC analyzed audio auto-scan candidate
12C:\AI\sci_voc_bot\resources\tobe\mp3False0TO-BE/VOC analyzed audio auto-scan candidate
13C:\jupyter_env\VOC_fullFalse0TO-BE/VOC analyzed audio auto-scan candidate
14C:\jupyter_env\VOC_sample1000_2False0TO-BE/VOC analyzed audio auto-scan candidate
15C:\jupyter_env\datasets0406\02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
16C:\jupyter_env\datasets0413\02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
17C:\jupyter_env\datasets0223\02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
18/mnt/data/v180_src/data/voc/audio_wav_16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
19/mnt/data/v180_src/data/voc/audio_rawFalse0TO-BE/VOC analyzed audio auto-scan candidate
20/mnt/data/v180_src/data/tobe/audio_wav_16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
21/mnt/data/v180_src/data/tobe/audio_rawFalse0TO-BE/VOC analyzed audio auto-scan candidate
22/mnt/data/v180_src/datasets0406/02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
23/mnt/data/v180_src/datasets0413/02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
24/mnt/data/v180_src/datasets0223/02_wav16kFalse0TO-BE/VOC analyzed audio auto-scan candidate
25/mnt/data/v180_src/VOC_fullFalse0TO-BE/VOC analyzed audio auto-scan candidate
26/mnt/data/v180_src/VOC_sample1000_2False0TO-BE/VOC analyzed audio auto-scan candidate
27/mnt/data/v180_src/resources/tobe/audioFalse0TO-BE/VOC analyzed audio auto-scan candidate
28/mnt/data/v180_src/resources/tobe/wavFalse0TO-BE/VOC analyzed audio auto-scan candidate
29/mnt/data/v180_src/resources/tobe/mp3False0TO-BE/VOC analyzed audio auto-scan candidate
30/mnt/data/v180_src/resources/voc_audioFalse0TO-BE/VOC analyzed audio auto-scan candidate
31/mnt/data/v180_src/resources/diarization_inputTrue0TO-BE/VOC analyzed audio auto-scan candidate
32/mnt/data/v173_src/research_continuity/03_tobe_extension_research/tobe_extension_actual_manifest_v150.jsonFalse0TO-BE/VOC analyzed audio auto-scan candidate
33/mnt/data/v173_src/resources/diarization_inputFalse0TO-BE/VOC analyzed audio auto-scan candidate
34resources/diarization_input에 오디오가 없어 상태카드만 생성했습니다. 배포 실패 조건은 아닙니다.False0TO-BE/VOC analyzed audio auto-scan candidate
35resources/diarization_inputTrue0TO-BE/VOC analyzed audio auto-scan candidate
36/mnt/data/v173_src/results/tables/asis_tobe/strict_original_csv_schema_compare_v169.csvFalse0TO-BE/VOC analyzed audio auto-scan candidate
37/mnt/data/v173_src/results/tables/asis_tobe/strict_original_key_metric_compare_v169.csvFalse0TO-BE/VOC analyzed audio auto-scan candidate
38/mnt/data/v173_src/results/tables/asis_tobe/csv_schema_compare_resolved_v169.csvFalse0TO-BE/VOC analyzed audio auto-scan candidate
39/mnt/data/v173_src/results/tables/asis_tobe/key_metric_compare_resolved_v169.csvFalse0TO-BE/VOC analyzed audio auto-scan candidate
40SCHEMA_DIFF/ROW_DIFF/ASIS_ONLY/TOBE_ONLY가 교수님용 경고로 노출False0TO-BE/VOC analyzed audio auto-scan candidate
41/mnt/data/v173_src/results/tables/asis_tobe/kspon_consistency_metrics_v162.csvFalse0TO-BE/VOC analyzed audio auto-scan candidate
42/mnt/data/v173_src/resources/tobe/asis_tobe_comparison_visual.pngFalse0TO-BE/VOC analyzed audio auto-scan candidate
43/mnt/data/v173_src/resources/tobe/to_be_actual_visual_summary.pngFalse0TO-BE/VOC analyzed audio auto-scan candidate
44/mnt/data/v173_src/results/tables/asis_tobe/kspon_consistency_metrics_v160.csvFalse0TO-BE/VOC analyzed audio auto-scan candidate

산출물 CSV: research_continuity/24_speaker_actual_diarization_v176/speaker_tobe_audio_files_v179.csv (행 0, 열 4)

전체 행 포함
orderaudio_pathfile_idsuffix

산출물 텍스트: research_continuity/24_speaker_actual_diarization_v176/speaker_actual_diarization_report_v176.md

# SCI-VOC 7번 실제 화자분리 기반 고객-상담원 상호작용 확장분석 v180

- 상태: READY_TO_RUN_ACTUAL_DIARIZATION_NOT_EXECUTED
- 실제 화자분리 완료: False
- 입력 음성: 0건
- 입력 기준: 기존 TO-BE/VOC 분석 음성 자동 탐색
- 실제 세그먼트: 0건
- 본문 기준: 0413 AS-IS 통화 전체 음성 유지
- 본문 대체: 금지
- 고객-only 주장: 실제 diarization + role mapping 검증 전 금지

## 교수님 설명 문장
> 7번은 기존 AI-IS/0413 산출 기준을 유지한 채 기존 TO-BE/VOC 분석에 사용한 음성 경로에서 실제 화자분리를 수행하여 고객 발화와 상담원 발화의 상호작용 변화를 보는 별도 확장분석입니다. pyannote 기반 실제 세그먼트와 고객/상담원 role mapping이 확인되기 전에는 고객-only 또는 상담원 영향 결과로 주장하지 않겠습니다.

## 실행 기준
- pyannote.audio와 PYANNOTE_AUTH_TOKEN/HF_TOKEN이 있으면 실제 SPEAKER_00/SPEAKER_01 세그먼트를 생성합니다.
- 토큰 또는 pyannote가 없으면 가짜 분리를 만들지 않고 준비 필요 상태로 표시합니다.
- 분리된 화자별 wav는 로컬 분석용이며 공개 배포에는 포함하지 않습니다.

결과 해석

1,000통화 전체에서 세그먼트가 생성되었으므로 화자별 발화량·턴·응답 구조를 계산할 수 있는 기반이 마련됐다.

한계 및 논문 반영 기준

화자분리 라벨은 상대적 SPEAKER_00/01이며 실제 업무 역할은 별도 검증이 필요하다.