4. 실제 데이터 값 및 무결성 점검
논문 작성용 상세 본문
운영기에 표시되는 수치는 배포 시점의 JSON/CSV 결과를 기준으로 하며, 원천 후보 10,000건과 실제 분석 통화 1,000건을 구분한다.
화자분리 결과는 통화 파일 수, 세그먼트 수, 통화-화자 슬롯, 응답쌍, 디코딩 성공/실패 건수로 분리해 표시한다.
파일명에 .wav.wav가 보였던 문제는 표시용 문자열 처리 문제였으며, 실제 분석 파일과 세그먼트 결과의 무결성은 별도 진단표로 확인한다.
실제 데이터 값 검증은 단순한 화면 표시 확인이 아니라 파일 존재 여부, CSV 행 수, JSON 상태, 디코딩 성공 수, 세그먼트 수를 교차 확인하는 과정이다.
원천 후보 10,000건, 실제 분석 통화 1,000건, 화자 세그먼트 57,619건, 통화-화자 슬롯 2,000건은 서로 다른 분석 단위이다.
이 단위를 분리하지 않으면 2,000 슬롯을 2,000개의 원본 음성으로 오해하거나 세그먼트 수를 통화 수로 해석하는 오류가 발생한다.
분석 수치 및 결과표
표 4-1. 실제 데이터 계층
| 계층 | 건수 | 설명 |
|---|---|---|
| 원천 후보 | 10,000 | SOURCE_VOC_DIR 후보 |
| 실제 분석 통화 | 1,000 | TO-BE/화자분리 입력 |
| SPEAKER 세그먼트 | 57,619 | pyannote 결과 |
| 통화-화자 슬롯 | 2,000 | 1,000×2 |
| S0→S1 응답쌍 | 28,149 | 시간 순서 후보 |
표 4-2. 오디오 처리 무결성
| 항목 | 건수 | 판정 |
|---|---|---|
| 디코딩 성공 | 1,000 | 정상 |
| 디코딩 실패 | 0 | 0이면 정상 |
| energy 계산 완료 | 57,611 | 일부 극단 단구간 제외 |
| pitch 계산 완료 | 53,098 | voiced 구간 기준 |
표 4-Q. 연구 질문
| 번호 | 연구 질문 |
|---|---|
| 1 | 운영기 수치가 실제 파일·행·세그먼트 상태와 일치하는가? |
| 2 | 표시 오류와 실제 데이터 오류를 구분할 수 있는가? |
표 4-M. 분석 방법 및 도구
| 순서 | 방법/도구 |
|---|---|
| 1 | File diagnostics |
| 2 | Row count audit |
| 3 | Hash/size inventory |
| 4 | Decode success check |
| 5 | Public/deploy verification |
분석 그림 및 도식



원본 분석 산출물 연계
산출물 CSV: research_continuity/24_speaker_actual_diarization_v181/speaker_actual_file_diagnostics_v189.csv (행 1,000, 열 8)
대용량 표 요약·앞/뒤 표본 포함, 원본은 데이터 ZIP 수록
| file | duration_sec | sample_rate | channels | speaker_count | segment_count | status | error |
|---|---|---|---|---|---|---|---|
| 00__350002022300000.wav | 531.81 | 8000 | 1 | 2 | 194 | OK_2_SPEAKERS | |
| 00__350002022300001.wav | 148.71 | 8000 | 1 | 2 | 61 | OK_2_SPEAKERS | |
| 00__350002022300002.wav | 65.4 | 8000 | 1 | 2 | 36 | OK_2_SPEAKERS | |
| 00__350002022300003.wav | 54.3 | 8000 | 1 | 2 | 30 | OK_2_SPEAKERS | |
| 00__350002022300004.wav | 52.98 | 8000 | 1 | 2 | 31 | OK_2_SPEAKERS | |
| 00__350002022300005.wav | 30.96 | 8000 | 1 | 2 | 13 | OK_2_SPEAKERS | |
| 00__350002022300006.wav | 100.08 | 8000 | 1 | 2 | 53 | OK_2_SPEAKERS | |
| 00__350002022300007.wav | 222.0 | 8000 | 1 | 2 | 63 | OK_2_SPEAKERS | |
| 00__350002022300008.wav | 77.01 | 8000 | 1 | 2 | 24 | OK_2_SPEAKERS | |
| 00__350002022300009.wav | 72.12 | 8000 | 1 | 2 | 35 | OK_2_SPEAKERS | |
| 00__350002022300010.wav | 6.57 | 8000 | 1 | 1 | 2 | PARTIAL_1_SPEAKER | single speaker label only |
| 00__350002022300011.wav | 158.19 | 8000 | 1 | 2 | 49 | OK_2_SPEAKERS | |
| 00__350002022300012.wav | 235.17 | 8000 | 1 | 2 | 97 | OK_2_SPEAKERS | |
| 00__350002022300013.wav | 321.0 | 8000 | 1 | 2 | 150 | OK_2_SPEAKERS | |
| 00__350002022300014.wav | 47.67 | 8000 | 1 | 2 | 23 | OK_2_SPEAKERS | |
| 00__350002022300015.wav | 48.96 | 8000 | 1 | 2 | 19 | OK_2_SPEAKERS | |
| 00__350002022300016.wav | 22.5 | 8000 | 1 | 2 | 13 | OK_2_SPEAKERS | |
| 00__350002022300017.wav | 24.3 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | |
| 00__350002022300018.wav | 521.7 | 8000 | 1 | 2 | 227 | OK_2_SPEAKERS | |
| 00__350002022300019.wav | 14.94 | 8000 | 1 | 2 | 10 | OK_2_SPEAKERS | |
| 00__350002022300020.wav | 1038.18 | 8000 | 1 | 2 | 377 | OK_2_SPEAKERS | |
| 00__350002022300021.wav | 524.82 | 8000 | 1 | 2 | 178 | OK_2_SPEAKERS | |
| 00__350002022300022.wav | 27.69 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | |
| 00__350002022300023.wav | 299.82 | 8000 | 1 | 2 | 119 | OK_2_SPEAKERS | |
| 00__350002022300024.wav | 31.59 | 8000 | 1 | 2 | 19 | OK_2_SPEAKERS | |
| ... 중간 950행은 전체 데이터 부록 ZIP에 원본으로 포함 ... | |||||||
| 09__350002022300975.wav | 26.1 | 8000 | 1 | 2 | 11 | OK_2_SPEAKERS | |
| 09__350002022300976.wav | 123.42 | 8000 | 1 | 2 | 55 | OK_2_SPEAKERS | |
| 09__350002022300977.wav | 120.75 | 8000 | 1 | 2 | 53 | OK_2_SPEAKERS | |
| 09__350002022300978.wav | 73.59 | 8000 | 1 | 2 | 35 | OK_2_SPEAKERS | |
| 09__350002022300979.wav | 5.22 | 8000 | 1 | 1 | 2 | PARTIAL_1_SPEAKER | single speaker label only |
| 09__350002022300980.wav | 45.24 | 8000 | 1 | 2 | 28 | OK_2_SPEAKERS | |
| 09__350002022300981.wav | 150.36 | 8000 | 1 | 2 | 60 | OK_2_SPEAKERS | |
| 09__350002022300982.wav | 7.44 | 8000 | 1 | 1 | 1 | PARTIAL_1_SPEAKER | single speaker label only |
| 09__350002022300983.wav | 204.45 | 8000 | 1 | 2 | 104 | OK_2_SPEAKERS | |
| 09__350002022300984.wav | 6.84 | 8000 | 1 | 1 | 1 | PARTIAL_1_SPEAKER | single speaker label only |
| 09__350002022300985.wav | 47.94 | 8000 | 1 | 2 | 18 | OK_2_SPEAKERS | |
| 09__350002022300986.wav | 173.46 | 8000 | 1 | 2 | 83 | OK_2_SPEAKERS | |
| 09__350002022300987.wav | 174.3 | 8000 | 1 | 2 | 68 | OK_2_SPEAKERS | |
| 09__350002022300988.wav | 164.52 | 8000 | 1 | 2 | 58 | OK_2_SPEAKERS | |
| 09__350002022300989.wav | 523.2 | 8000 | 1 | 2 | 200 | OK_2_SPEAKERS | |
| 09__350002022300990.wav | 176.52 | 8000 | 1 | 2 | 67 | OK_2_SPEAKERS | |
| 09__350002022300991.wav | 149.64 | 8000 | 1 | 2 | 60 | OK_2_SPEAKERS | |
| 09__350002022300992.wav | 62.97 | 8000 | 1 | 2 | 26 | OK_2_SPEAKERS | |
| 09__350002022300993.wav | 32.94 | 8000 | 1 | 2 | 10 | OK_2_SPEAKERS | |
| 09__350002022300994.wav | 16.5 | 8000 | 1 | 2 | 6 | OK_2_SPEAKERS | |
| 09__350002022300995.wav | 156.12 | 8000 | 1 | 2 | 79 | OK_2_SPEAKERS | |
| 09__350002022300996.wav | 60.09 | 8000 | 1 | 2 | 45 | OK_2_SPEAKERS | |
| 09__350002022300997.wav | 107.4 | 8000 | 1 | 2 | 59 | OK_2_SPEAKERS | |
| 09__350002022300998.wav | 45.84 | 8000 | 1 | 2 | 14 | OK_2_SPEAKERS | |
| 09__350002022300999.wav | 35.52 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS |
산출물 CSV: research_continuity/24_speaker_actual_diarization_v181/speaker_actual_file_diagnostics_v199.csv (행 1,000, 열 8)
대용량 표 요약·앞/뒤 표본 포함, 원본은 데이터 ZIP 수록
| file | duration_sec | sample_rate | channels | speaker_count | segment_count | status | error |
|---|---|---|---|---|---|---|---|
| 00__350002022300000.wav | 531.81 | 8000 | 1 | 2 | 194 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300001.wav | 148.71 | 8000 | 1 | 2 | 61 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300002.wav | 65.4 | 8000 | 1 | 2 | 36 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300003.wav | 54.3 | 8000 | 1 | 2 | 30 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300004.wav | 52.98 | 8000 | 1 | 2 | 31 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300005.wav | 30.96 | 8000 | 1 | 2 | 13 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300006.wav | 100.08 | 8000 | 1 | 2 | 53 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300007.wav | 222.0 | 8000 | 1 | 2 | 63 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300008.wav | 77.01 | 8000 | 1 | 2 | 24 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300009.wav | 72.12 | 8000 | 1 | 2 | 35 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300010.wav | 6.57 | 8000 | 1 | 1 | 2 | PARTIAL_1_SPEAKER | single speaker label only | soundfile:LibsndfileError;wave:Error |
| 00__350002022300011.wav | 158.19 | 8000 | 1 | 2 | 49 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300012.wav | 235.17 | 8000 | 1 | 2 | 97 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300013.wav | 321.0 | 8000 | 1 | 2 | 150 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300014.wav | 47.67 | 8000 | 1 | 2 | 23 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300015.wav | 48.96 | 8000 | 1 | 2 | 19 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300016.wav | 22.5 | 8000 | 1 | 2 | 13 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300017.wav | 24.3 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300018.wav | 521.7 | 8000 | 1 | 2 | 227 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300019.wav | 14.94 | 8000 | 1 | 2 | 10 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300020.wav | 1038.18 | 8000 | 1 | 2 | 377 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300021.wav | 524.82 | 8000 | 1 | 2 | 178 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300022.wav | 27.69 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300023.wav | 299.82 | 8000 | 1 | 2 | 119 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 00__350002022300024.wav | 31.59 | 8000 | 1 | 2 | 19 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| ... 중간 950행은 전체 데이터 부록 ZIP에 원본으로 포함 ... | |||||||
| 09__350002022300975.wav | 26.1 | 8000 | 1 | 2 | 11 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300976.wav | 123.42 | 8000 | 1 | 2 | 55 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300977.wav | 120.75 | 8000 | 1 | 2 | 53 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300978.wav | 73.59 | 8000 | 1 | 2 | 35 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300979.wav | 5.22 | 8000 | 1 | 1 | 2 | PARTIAL_1_SPEAKER | single speaker label only | soundfile:LibsndfileError;wave:Error |
| 09__350002022300980.wav | 45.24 | 8000 | 1 | 2 | 28 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300981.wav | 150.36 | 8000 | 1 | 2 | 60 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300982.wav | 7.44 | 8000 | 1 | 1 | 1 | PARTIAL_1_SPEAKER | single speaker label only | soundfile:LibsndfileError;wave:Error |
| 09__350002022300983.wav | 204.45 | 8000 | 1 | 2 | 104 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300984.wav | 6.84 | 8000 | 1 | 1 | 1 | PARTIAL_1_SPEAKER | single speaker label only | soundfile:LibsndfileError;wave:Error |
| 09__350002022300985.wav | 47.94 | 8000 | 1 | 2 | 18 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300986.wav | 173.46 | 8000 | 1 | 2 | 83 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300987.wav | 174.3 | 8000 | 1 | 2 | 68 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300988.wav | 164.52 | 8000 | 1 | 2 | 58 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300989.wav | 523.2 | 8000 | 1 | 2 | 200 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300990.wav | 176.52 | 8000 | 1 | 2 | 67 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300991.wav | 149.64 | 8000 | 1 | 2 | 60 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300992.wav | 62.97 | 8000 | 1 | 2 | 26 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300993.wav | 32.94 | 8000 | 1 | 2 | 10 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300994.wav | 16.5 | 8000 | 1 | 2 | 6 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300995.wav | 156.12 | 8000 | 1 | 2 | 79 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300996.wav | 60.09 | 8000 | 1 | 2 | 45 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300997.wav | 107.4 | 8000 | 1 | 2 | 59 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300998.wav | 45.84 | 8000 | 1 | 2 | 14 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
| 09__350002022300999.wav | 35.52 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | soundfile:LibsndfileError;wave:Error |
산출물 CSV: research_continuity/24_speaker_actual_diarization_v181/speaker_actual_file_diagnostics_v200.csv (행 1,000, 열 8)
대용량 표 요약·앞/뒤 표본 포함, 원본은 데이터 ZIP 수록
| file | duration_sec | sample_rate | channels | speaker_count | segment_count | status | error |
|---|---|---|---|---|---|---|---|
| 00__350002022300000.wav | 531.81 | 8000 | 1 | 2 | 194 | OK_2_SPEAKERS | |
| 00__350002022300001.wav | 148.71 | 8000 | 1 | 2 | 61 | OK_2_SPEAKERS | |
| 00__350002022300002.wav | 65.4 | 8000 | 1 | 2 | 36 | OK_2_SPEAKERS | |
| 00__350002022300003.wav | 54.3 | 8000 | 1 | 2 | 30 | OK_2_SPEAKERS | |
| 00__350002022300004.wav | 52.98 | 8000 | 1 | 2 | 31 | OK_2_SPEAKERS | |
| 00__350002022300005.wav | 30.96 | 8000 | 1 | 2 | 13 | OK_2_SPEAKERS | |
| 00__350002022300006.wav | 100.08 | 8000 | 1 | 2 | 53 | OK_2_SPEAKERS | |
| 00__350002022300007.wav | 222.0 | 8000 | 1 | 2 | 63 | OK_2_SPEAKERS | |
| 00__350002022300008.wav | 77.01 | 8000 | 1 | 2 | 24 | OK_2_SPEAKERS | |
| 00__350002022300009.wav | 72.12 | 8000 | 1 | 2 | 35 | OK_2_SPEAKERS | |
| 00__350002022300010.wav | 6.57 | 8000 | 1 | 1 | 2 | PARTIAL_1_SPEAKER | single speaker label only |
| 00__350002022300011.wav | 158.19 | 8000 | 1 | 2 | 49 | OK_2_SPEAKERS | |
| 00__350002022300012.wav | 235.17 | 8000 | 1 | 2 | 97 | OK_2_SPEAKERS | |
| 00__350002022300013.wav | 321.0 | 8000 | 1 | 2 | 150 | OK_2_SPEAKERS | |
| 00__350002022300014.wav | 47.67 | 8000 | 1 | 2 | 23 | OK_2_SPEAKERS | |
| 00__350002022300015.wav | 48.96 | 8000 | 1 | 2 | 19 | OK_2_SPEAKERS | |
| 00__350002022300016.wav | 22.5 | 8000 | 1 | 2 | 13 | OK_2_SPEAKERS | |
| 00__350002022300017.wav | 24.3 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | |
| 00__350002022300018.wav | 521.7 | 8000 | 1 | 2 | 227 | OK_2_SPEAKERS | |
| 00__350002022300019.wav | 14.94 | 8000 | 1 | 2 | 10 | OK_2_SPEAKERS | |
| 00__350002022300020.wav | 1038.18 | 8000 | 1 | 2 | 377 | OK_2_SPEAKERS | |
| 00__350002022300021.wav | 524.82 | 8000 | 1 | 2 | 178 | OK_2_SPEAKERS | |
| 00__350002022300022.wav | 27.69 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS | |
| 00__350002022300023.wav | 299.82 | 8000 | 1 | 2 | 119 | OK_2_SPEAKERS | |
| 00__350002022300024.wav | 31.59 | 8000 | 1 | 2 | 19 | OK_2_SPEAKERS | |
| ... 중간 950행은 전체 데이터 부록 ZIP에 원본으로 포함 ... | |||||||
| 09__350002022300975.wav | 26.1 | 8000 | 1 | 2 | 11 | OK_2_SPEAKERS | |
| 09__350002022300976.wav | 123.42 | 8000 | 1 | 2 | 55 | OK_2_SPEAKERS | |
| 09__350002022300977.wav | 120.75 | 8000 | 1 | 2 | 53 | OK_2_SPEAKERS | |
| 09__350002022300978.wav | 73.59 | 8000 | 1 | 2 | 35 | OK_2_SPEAKERS | |
| 09__350002022300979.wav | 5.22 | 8000 | 1 | 1 | 2 | PARTIAL_1_SPEAKER | single speaker label only |
| 09__350002022300980.wav | 45.24 | 8000 | 1 | 2 | 28 | OK_2_SPEAKERS | |
| 09__350002022300981.wav | 150.36 | 8000 | 1 | 2 | 60 | OK_2_SPEAKERS | |
| 09__350002022300982.wav | 7.44 | 8000 | 1 | 1 | 1 | PARTIAL_1_SPEAKER | single speaker label only |
| 09__350002022300983.wav | 204.45 | 8000 | 1 | 2 | 104 | OK_2_SPEAKERS | |
| 09__350002022300984.wav | 6.84 | 8000 | 1 | 1 | 1 | PARTIAL_1_SPEAKER | single speaker label only |
| 09__350002022300985.wav | 47.94 | 8000 | 1 | 2 | 18 | OK_2_SPEAKERS | |
| 09__350002022300986.wav | 173.46 | 8000 | 1 | 2 | 83 | OK_2_SPEAKERS | |
| 09__350002022300987.wav | 174.3 | 8000 | 1 | 2 | 68 | OK_2_SPEAKERS | |
| 09__350002022300988.wav | 164.52 | 8000 | 1 | 2 | 58 | OK_2_SPEAKERS | |
| 09__350002022300989.wav | 523.2 | 8000 | 1 | 2 | 200 | OK_2_SPEAKERS | |
| 09__350002022300990.wav | 176.52 | 8000 | 1 | 2 | 67 | OK_2_SPEAKERS | |
| 09__350002022300991.wav | 149.64 | 8000 | 1 | 2 | 60 | OK_2_SPEAKERS | |
| 09__350002022300992.wav | 62.97 | 8000 | 1 | 2 | 26 | OK_2_SPEAKERS | |
| 09__350002022300993.wav | 32.94 | 8000 | 1 | 2 | 10 | OK_2_SPEAKERS | |
| 09__350002022300994.wav | 16.5 | 8000 | 1 | 2 | 6 | OK_2_SPEAKERS | |
| 09__350002022300995.wav | 156.12 | 8000 | 1 | 2 | 79 | OK_2_SPEAKERS | |
| 09__350002022300996.wav | 60.09 | 8000 | 1 | 2 | 45 | OK_2_SPEAKERS | |
| 09__350002022300997.wav | 107.4 | 8000 | 1 | 2 | 59 | OK_2_SPEAKERS | |
| 09__350002022300998.wav | 45.84 | 8000 | 1 | 2 | 14 | OK_2_SPEAKERS | |
| 09__350002022300999.wav | 35.52 | 8000 | 1 | 2 | 12 | OK_2_SPEAKERS |
산출물 CSV: results/tables/data_quality_action_plan.csv (행 3, 열 7)
전체 행 포함
| priority | action_code | action_name | trigger_items | reason | auto_executable | command_hint |
|---|---|---|---|---|---|---|
| 1 | FIX_VOC_STT_WPM | VOC STT/WPM 자동 복구 | VOC transcript column; VOC word_cnt; VOC text_len; VOC wpm; Stress index z_wpm | 전사문, 단어 수, WPM 또는 z_wpm이 비정상입니다. VOC STT부터 다시 돌려야 합니다. | YES | python src/auto_remediate.py --fix-voc-stt-wpm --model medium --limit <N> --overwrite-stt |
| 3 | REVIEW_FEATURE_QUALITY | 상수/결측 변수 해석 제한 표시 | Feature quality table | 상수 또는 결측 처리된 변수가 있습니다. 자동 복구보다 STT/원본 데이터 확인이 우선입니다. | PARTIAL | 먼저 FIX_VOC_STT_WPM 실행. 이후에도 남으면 해당 변수는 본문에서 보조/제외로 표시 |
| 4 | RUN_LARGER_SAMPLE | 표본 수 확대 재실행 | VOC feature sample size | 현재는 테스트/파일럿 표본입니다. SCI 원고용은 500개 이상, 가능하면 전체/998건으로 재실행해야 합니다. | YES | 대시보드 테스트 개수 500/1000/전체 선택 후 전체 파이프라인 또는 자동 조치 실행 |
산출물 CSV: results/tables/deploy_result_integrity.csv (행 22, 열 7)
전체 행 포함
| artifact | source_type | path | exists | rows_or_exists | mtime | size_kb |
|---|---|---|---|---|---|---|
| voc_stt_small | root | C:\AI\sci_voc_bot\data\voc\stt\voc_whisper_small_results.csv | True | 1000 | 2026-07-02 19:51:08 | 1925.4 |
| voc_stt_small | snapshot | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\data\voc\stt\voc_whisper_small_results.csv | True | 1000 | 2026-07-02 19:51:08 | 1925.4 |
| voc_stt_small | branch02 | C:\AI\sci_voc_bot\analysis_branches\02_tobe_recalc_n1000\data\voc\stt\voc_whisper_small_results.csv | True | 1000 | 2026-07-02 19:51:08 | 1925.4 |
| voc_stt_medium | root | C:\AI\sci_voc_bot\data\voc\stt\voc_whisper_medium_results.csv | True | 8 | 2026-07-02 13:25:39 | 6.5 |
| voc_stt_medium | snapshot | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\data\voc\stt\voc_whisper_medium_results.csv | True | 8 | 2026-07-02 13:25:39 | 6.5 |
| voc_stt_medium | branch02 | C:\AI\sci_voc_bot\analysis_branches\02_tobe_recalc_n1000\data\voc\stt\voc_whisper_medium_results.csv | True | 8 | 2026-07-02 13:25:39 | 6.5 |
| features | root | C:\AI\sci_voc_bot\data\voc\features\voc_features.csv | True | 1000 | 2026-07-03 17:11:46 | 1905.8 |
| features | branch02 | C:\AI\sci_voc_bot\analysis_branches\02_tobe_recalc_n1000\data\voc\features\voc_features.csv | True | 1000 | 2026-07-03 17:11:46 | 1905.8 |
| features | snapshot | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\data\voc\features\voc_features.csv | True | 1000 | 2026-07-03 17:11:46 | 1905.8 |
| stress | root | C:\AI\sci_voc_bot\results\stress_index\voc_stress_score_rebuilt.csv | True | 1000 | 2026-07-03 17:11:49 | 2019.2 |
| stress | root_alt_features | C:\AI\sci_voc_bot\data\voc\features\voc_stress_score_rebuilt.csv | False | 0 | 0.0 | |
| stress | root_alt_tables | C:\AI\sci_voc_bot\results\tables\voc_stress_score_rebuilt.csv | False | 0 | 0.0 | |
| stress | branch02 | C:\AI\sci_voc_bot\analysis_branches\02_tobe_recalc_n1000\results\stress_index\voc_stress_score_rebuilt.csv | True | 1000 | 2026-07-03 17:11:49 | 2019.2 |
| stress | branch02_alt | C:\AI\sci_voc_bot\analysis_branches\02_tobe_recalc_n1000\data\voc\features\voc_stress_score_rebuilt.csv | False | 0 | 0.0 | |
| stress | snapshot | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\results\stress_index\voc_stress_score_rebuilt.csv | True | 1000 | 2026-07-03 17:11:49 | 2019.2 |
| stress | snapshot_alt | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\data\voc\features\voc_stress_score_rebuilt.csv | False | 0 | 0.0 | |
| aiis_final_status | root | C:\AI\sci_voc_bot\results\runtime\aiis_final_diff_status.json | True | 1 | 2026-07-03 19:00:09 | 0.9 |
| aiis_final_status | snapshot | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\results\runtime\aiis_final_diff_status.json | False | 0 | 0.0 | |
| result_similarity_status | root | C:\AI\sci_voc_bot\results\runtime\result_similarity_status.json | True | 1 | 2026-07-04 14:23:48 | 0.6 |
| result_similarity_status | snapshot | C:\AI\sci_voc_bot\results_by_count\n1000\snapshot\results\runtime\result_similarity_status.json | False | 0 | 0.0 | |
| scie_pack | root | C:\AI\sci_voc_bot\reports\scie_submission\scie_submission_readiness_pack.docx | True | 1 | 2026-07-03 13:20:41 | 39.4 |
| scie_pack | branch03 | C:\AI\sci_voc_bot\analysis_branches\03_paper_safe_asis_main\reports\scie_submission\scie_submission_readiness_pack.docx | True | 1 | 2026-07-03 13:20:41 | 39.4 |
산출물 CSV: results/tables/final_paper_quality_check.csv (행 53, 열 6)
전체 행 포함
| section_id | section_title | issue_type | matched_text | severity | suggested_fix |
|---|---|---|---|---|---|
| 01_abstract | 초록 및 핵심 기여 | raw_figure_filename | 표로서의 타당성 근거를 확보하는 데 있다. 제안된 프레임워크는 그림 1(fig01_framework.png)에 도식화되어 있으며, 수집된 음성 데이터에 대해 자동 음성 인식(ST | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 01_abstract | 초록 및 핵심 기여 | raw_figure_filename | stt_reliability.csv ## 이 목차에 포함된 이미지 - fig01_framework.png | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 01_abstract | 초록 및 핵심 기여 | raw_csv_filename | 탐색적 도구로서의 가능성을 보여준다. ## 이 목차에 포함된 표 - construct_validity_summary.csv - stt_reliability.csv ## 이 목차에 포함된 이미지 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 01_abstract | 초록 및 핵심 기여 | raw_csv_filename | 함된 표 - construct_validity_summary.csv - stt_reliability.csv ## 이 목차에 포함된 이미지 - fig01_framework.png | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 01_abstract | 초록 및 핵심 기여 | raw_missing_value | 당도(convergent validity)와 변별 타당도(discriminant validity)를 평가하였다. 수렴 타당도 지표로서 energy m | high | 결측/None 표기가 본문에 남아 있음 |
| 01_abstract | 초록 및 핵심 기여 | diagnosis_claim | 관찰되어 지수의 해석에 주의가 필요함을 시사한다. 이는 제안된 지수가 임상적 스트레스 진단이나 예측 모형으로 직접 사용되기보다는, 음성 특징 기반 스트레스 평가의 | medium | 진단 표현은 제한적으로만 사용해야 함 |
| 02_introduction | 서론 | raw_figure_filename | 초점을 맞추어, 내적 구성 타당도의 근거를 제시하고자 한다. 그림 1(fig01_framework.png)은 본 연구에서 제안하는 전체 분석 프레임워크를 도식화한 것이다. 이 | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 02_introduction | 서론 | raw_figure_filename | 된 표 (해당 목차에 포함된 표 없음) ## 이 목차에 포함된 이미지 fig01_framework.png | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 02_introduction | 서론 | diagnosis_claim | 일 지수로 통합하는 접근을 취한다. 이때 중요한 점은 본 연구의 결과를 임상적 스트레스 진단이나 지도학습 기반 예측모형으로 설명하지 않는다는 것이다. 대신, 제안된 | medium | 진단 표현은 제한적으로만 사용해야 함 |
| 03_related_work | 선행연구 | diagnosis_claim | 류하는 데 초점을 맞춘다. 그러나 이러한 접근법은 외부 준거 라벨(예: 임상적 스트레스 진단)이 없는 조건에서는 적용이 제한적이다. 본 연구는 지도학습 기반 예측모 | medium | 진단 표현은 제한적으로만 사용해야 함 |
| 04_data_preprocessing | 데이터 및 전처리 | raw_figure_filename | 관 후 폐기 예정이며, 분석 결과는 집계 수준에서만 보고된다. 그림 2(fig02_stress_distribution.png)는 전체 데이터의 스트레스 점수 분포를 시각화한 것으로, 스트레스 점수 | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 04_data_preprocessing | 데이터 및 전처리 | raw_figure_filename | feature_quality.csv ## 이 목차에 포함된 이미지 - fig02_stress_distribution.png | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 04_data_preprocessing | 데이터 및 전처리 | raw_csv_filename | 가정을 일부 충족할 가능성을 시사한다. ## 이 목차에 포함된 표 - descriptive_statistics.csv - stress_index_feature_quality.csv ## | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 04_data_preprocessing | 데이터 및 전처리 | raw_csv_filename | 차에 포함된 표 - descriptive_statistics.csv - stress_index_feature_quality.csv ## 이 목차에 포함된 이미지 - fig02_stress_distri | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 04_data_preprocessing | 데이터 및 전처리 | aihub_claim | 향 모델 사전 학습 및 특징 추출 파이프라인 검증에 활용되었다. 셋째, AIHub 보조 데이터는 다양한 화자와 발화 환경을 포함하여 음성 처리 알고리즘의 | medium | AIHub를 실제 검증 결과처럼 썼는지 확인 필요 |
| 05_stress_index_method | 스트레스 지수 설계 방법 | raw_figure_filename | 는 표본 내에서 스트레스 수준이 비교적 고르게 분포함을 시사한다. 그림 fig02_stress_distribution.png는 이 지수의 분포를 시각화하여 보여준다. 결론적으로, 본 연구에서 제 | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 05_stress_index_method | 스트레스 지수 설계 방법 | raw_figure_filename | tive_statistics.csv ## 이 목차에 포함된 이미지 - fig02_stress_distribution.png | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 05_stress_index_method | 스트레스 지수 설계 방법 | raw_csv_filename | 다만, 기술통계 결과 WPM 변수는 모든 관측치에서 0의 값을 보여(표 descriptive_statistics.csv 참조) 실제 지수 계산에서 기여도가 없었으나, 이론적 틀을 유지하기 위 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 05_stress_index_method | 스트레스 지수 설계 방법 | raw_csv_filename | 는 평균 0.495, 표준편차 0.194, 범위 0–1로 나타났으며(표 descriptive_statistics.csv 참조), 이는 표본 내에서 스트레스 수준이 비교적 고르게 분포함을 시사 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 05_stress_index_method | 스트레스 지수 설계 방법 | raw_csv_filename | 측모형으로 확대 해석되어서는 안 된다. ## 이 목차에 포함된 표 - descriptive_statistics.csv ## 이 목차에 포함된 이미지 - fig02_stress_distri | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 05_stress_index_method | 스트레스 지수 설계 방법 | diagnosis_claim | ernal construct validity) 근거로 해석되어야 하며, 임상적 스트레스 진단이나 지도학습 기반 예측모형으로 확대 해석되어서는 안 된다. ## 이 | medium | 진단 표현은 제한적으로만 사용해야 함 |
| 06_stt_reliability | STT 신뢰도 검증 | raw_csv_filename | 하는 지표로 활용된다는 점을 강조한다. ## 이 목차에 포함된 표 - stt_reliability.csv ## 이 목차에 포함된 이미지 - fig_stt_reliability | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 06_stt_reliability | STT 신뢰도 검증 | diagnosis_claim | 련된 음성 변화를 반영할 가능성을 시사한다. 다만, 본 연구의 WPM은 임상적 스트레스 진단이나 지도학습 기반 예측모형으로 사용되지 않으며, 오직 음성 특성의 상대 | medium | 진단 표현은 제한적으로만 사용해야 함 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | 68, -0.412]로 부적 상관의 방향성이 일관되게 유지되었다. 그림 fig04_bootstrap_ci.png는 각 변수의 Bootstrap 신뢰구간을 시각화한다. ## 3.3 가 | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | 화 지속 시간이 지수 구성에 중요한 기여를 하고 있음을 시사한다. 그림 fig05_weight_sensitivity.png는 각 시나리오별 상관계수 변화를 도시한다. ## 3.4 Leave-O | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | rgy_mean.png - scatter_pitch_mean.png - fig04_bootstrap_ci.png - fig05_weight_sensitivity.png - anova_ | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | tch_mean.png - fig04_bootstrap_ci.png - fig05_weight_sensitivity.png - anova_energy_mean.png - anova_pitch_m | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | 며, 기존 문헌에서 보고된 음성 스트레스 지표와 일관된 결과이다. 그림 scatter_energy_mean.png와 scatter_pitch_mean.png는 각 변수와 스트레스 점수 | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | 와 일관된 결과이다. 그림 scatter_energy_mean.png와 scatter_pitch_mean.png는 각 변수와 스트레스 점수 간의 산점도를 보여준다. 판별 타당도 측면 | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | alidity_summary.csv ## 이 목차에 포함된 이미지 - scatter_energy_mean.png - scatter_pitch_mean.png - fig04_bootst | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_figure_filename | 목차에 포함된 이미지 - scatter_energy_mean.png - scatter_pitch_mean.png - fig04_bootstrap_ci.png - fig05_weight | medium | 그림 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | 준거를 활용한 추가 검증이 요구된다. ## 이 목차에 포함된 표 - correlation_validity.csv - bootstrap_ci.csv - weight_sensitivity | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | 목차에 포함된 표 - correlation_validity.csv - bootstrap_ci.csv - weight_sensitivity.csv - loo_stabilit | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | ation_validity.csv - bootstrap_ci.csv - weight_sensitivity.csv - loo_stability.csv - anova_profile.csv | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | strap_ci.csv - weight_sensitivity.csv - loo_stability.csv - anova_profile.csv - anova_group_descr | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | t_sensitivity.csv - loo_stability.csv - anova_profile.csv - anova_group_descriptive.csv - constru | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | loo_stability.csv - anova_profile.csv - anova_group_descriptive.csv - construct_validity_summary.csv ## 이 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_csv_filename | ile.csv - anova_group_descriptive.csv - construct_validity_summary.csv ## 이 목차에 포함된 이미지 - scatter_energy_mean | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 07_construct_validity | 구성 타당도 검증 결과 | raw_missing_value | 보여준다. 판별 타당도 측면에서, 분당 음절 수(WPM)는 상관계수가 NaN으로 산출되어 분석에서 제외되었다. 이는 WPM이 본 연구의 스트레스 점 | high | 결측/None 표기가 본문에 남아 있음 |
| 08_robustness_sensitivity | 강건성 및 민감도 분석 | raw_csv_filename | 기준 지수와의 상관관계 및 평균 절대 차이(MAD)를 평가하였다. 표 `stt_error_sensitivity.csv`에 제시된 바와 같이, 모든 섭동 시나리오에서 기준 지수와의 상관계수는 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 08_robustness_sensitivity | 강건성 및 민감도 분석 | raw_csv_filename | ch_gt_350_removed, n=100) 조건을 적용하였다. 표 `outlier_robustness.csv`에 제시된 바와 같이, 전체 데이터에서 에너지 평균과 피치 평균 간 상 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 08_robustness_sensitivity | 강건성 및 민감도 분석 | raw_csv_filename | 상관 구조가 더 명확해짐을 시사한다. ## 이 목차에 포함된 표 - stt_error_sensitivity.csv - outlier_robustness.csv ## 이 목차에 포함된 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 08_robustness_sensitivity | 강건성 및 민감도 분석 | raw_csv_filename | 목차에 포함된 표 - stt_error_sensitivity.csv - outlier_robustness.csv ## 이 목차에 포함된 이미지 - fig_stt_error_sensi | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 09_discussion | 논의 | raw_csv_filename | 접근법을 도입한 후속 연구가 요구된다. ## 이 목차에 포함된 표 - construct_validity_summary.csv ## 이 목차에 포함된 이미지 - (해당 목차에 포함된 이미지가 명시 | medium | CSV 파일명이 본문에 그대로 남아 있음 |
| 09_discussion | 논의 | diagnosis_claim | 다. 따라서 제안된 지수의 타당도는 내적 구성 타당도 근거에 국한되며, 임상적 스트레스 진단이나 지도학습 기반 예측모형으로 확장 해석되어서는 안 된다. 이 지수는 | medium | 진단 표현은 제한적으로만 사용해야 함 |
| 10_limitations_conclusion | 한계 및 결론 | placeholder_figure | 이 스트레스와 관련된 심리적 상태를 반영할 수 있음을 시사한다. 특히, [그림 X]에서 확인할 수 있듯이, 특정 음성 임베딩 차원과 텍스트 부정성 점수 간 | high | 그림 placeholder가 남아 있음 |
| 10_limitations_conclusion | 한계 및 결론 | unverified_embedding | 를 향상시키기 위한 후처리 과정을 도입해야 한다. 다섯째, 본 연구는 음성 임베딩(embeddings)과 텍스트 부정성 점수라는 두 가지 단일 모달리티에 | high | 실제 분석하지 않은 임베딩 표현 가능성 |
| 10_limitations_conclusion | 한계 및 결론 | unverified_embedding | 위한 후처리 과정을 도입해야 한다. 다섯째, 본 연구는 음성 임베딩(embeddings)과 텍스트 부정성 점수라는 두 가지 단일 모달리티에 초점을 맞추었다. | high | 실제 분석하지 않은 임베딩 표현 가능성 |
| 10_limitations_conclusion | 한계 및 결론 | unverified_embedding | 수 있음을 시사한다. 특히, [그림 X]에서 확인할 수 있듯이, 특정 음성 임베딩 차원과 텍스트 부정성 점수 간의 상관 패턴은 이론적으로 예측된 방향성과 | high | 실제 분석하지 않은 임베딩 표현 가능성 |
| 10_limitations_conclusion | 한계 및 결론 | unverified_text_negative | 비표준 발음에서 STT 오류율이 높아질 경우, 텍스트 기반 부정성 점수(text negativity scores)의 신뢰성이 저하될 수 있다. 또한, 사용된 오디오 코덱의 | high | 실제 분석하지 않은 텍스트 부정성 표현 가능성 |
| 10_limitations_conclusion | 한계 및 결론 | unverified_text_negative | 입해야 한다. 다섯째, 본 연구는 음성 임베딩(embeddings)과 텍스트 부정성 점수라는 두 가지 단일 모달리티에 초점을 맞추었다. 스트레스는 음성, | high | 실제 분석하지 않은 텍스트 부정성 표현 가능성 |
| 10_limitations_conclusion | 한계 및 결론 | unverified_text_negative | . 특히, [그림 X]에서 확인할 수 있듯이, 특정 음성 임베딩 차원과 텍스트 부정성 점수 간의 상관 패턴은 이론적으로 예측된 방향성과 일치하였다. 결론적으 | high | 실제 분석하지 않은 텍스트 부정성 표현 가능성 |
| 10_limitations_conclusion | 한계 및 결론 | diagnosis_claim | 몇 가지 중요한 한계를 지닌다. 첫째, 본 연구는 외부 준거 라벨(예: 임상적 스트레스 진단, 생리학적 측정치)이 부재한 상태에서 수행되었다. 따라서 제안된 지수들 | medium | 진단 표현은 제한적으로만 사용해야 함 |
산출물 텍스트: results/manuscript_text/data_quality_action_log_ko.md
# 데이터 품질 자동 조치 계획 ## 1. VOC STT/WPM 자동 복구 - 코드: `FIX_VOC_STT_WPM` - 원인: 전사문, 단어 수, WPM 또는 z_wpm이 비정상입니다. VOC STT부터 다시 돌려야 합니다. - 트리거: VOC transcript column; VOC word_cnt; VOC text_len; VOC wpm; Stress index z_wpm - 자동 실행 가능: YES - 실행 힌트: `python src/auto_remediate.py --fix-voc-stt-wpm --model medium --limit <N> --overwrite-stt` ## 3. 상수/결측 변수 해석 제한 표시 - 코드: `REVIEW_FEATURE_QUALITY` - 원인: 상수 또는 결측 처리된 변수가 있습니다. 자동 복구보다 STT/원본 데이터 확인이 우선입니다. - 트리거: Feature quality table - 자동 실행 가능: PARTIAL - 실행 힌트: `먼저 FIX_VOC_STT_WPM 실행. 이후에도 남으면 해당 변수는 본문에서 보조/제외로 표시` ## 4. 표본 수 확대 재실행 - 코드: `RUN_LARGER_SAMPLE` - 원인: 현재는 테스트/파일럿 표본입니다. SCI 원고용은 500개 이상, 가능하면 전체/998건으로 재실행해야 합니다. - 트리거: VOC feature sample size - 자동 실행 가능: YES - 실행 힌트: `대시보드 테스트 개수 500/1000/전체 선택 후 전체 파이프라인 또는 자동 조치 실행`
산출물 텍스트: results/manuscript_text/data_quality_warning_ko.md
# 데이터 품질 점검 결과 - PASS: 1 - WARN: 3 - FAIL: 5 - 논문용 사용 가능 여부: 불가 또는 추가 확인 필요 ## 조치 필요 항목 - **VOC Whisper STT result file** [WARN]: VOC STT 파일은 있으나 빈 전사문 비율이 높습니다. → 빈 전사문이 많으면 Whisper model/device 설정, 음성 변환 파일, VAD 설정을 확인하세요. - **VOC feature sample size** [WARN]: 현재 VOC 특징 데이터는 n=100입니다. → SCI 최종 원고 전에는 500개 이상, 가능하면 전체/998건으로 재실행하세요. - **VOC transcript column** [FAIL]: transcript가 대부분 비어 있습니다. 현재 결과는 STT 제외 테스트 결과입니다. → STT 제외 체크를 해제하고 VOC Whisper STT 포함으로 전체 파이프라인을 재실행하세요. - **VOC word_cnt** [FAIL]: word_cnt 산출 상태 확인 → FAIL이면 STT 포함 재실행 필요 - **VOC text_len** [FAIL]: text_len 산출 상태 확인 → FAIL이면 STT 포함 재실행 필요 - **VOC wpm** [FAIL]: wpm이 전부 0 또는 상수입니다. 논문용 stress_score에 사용할 수 없습니다. → STT 제외 체크 해제 → VOC Whisper STT 실행 → VOC 특징 추출 → Stress Index 재산출 순서로 다시 실행하세요. - **Stress index z_wpm** [FAIL]: z_wpm이 전부 0입니다. WPM이 지수에 반영되지 않았습니다. → VOC STT 포함 재실행 후 stress_score를 재산출하세요. - **Feature quality table** [WARN]: 상수/결측 처리된 변수가 있습니다. → 해당 변수가 후속 원고에서 현재 분석 결과처럼 해석되지 않도록 주의하세요. ## 실행 권장 순서 1. Whisper STT 메뉴에서 dataset=voc, model=medium으로 STT 실행 2. VOC 특징 추출 실행 3. Stress Index 재산출 실행 4. 데이터 품질 점검 실행 5. PASS 확인 후 구성 타당도 분석과 논문 원고 생성 진행
산출물 텍스트: results/manuscript_text/deploy_result_integrity_ko.md
# 모바일 배포 결과값 출처 점검 - 생성시각: 2026-07-04 18:35:46 - 프로파일: `n1000` - 판정: **READY** - 메시지: 모바일 배포에 사용할 Feature/Stress 결과가 확인됐습니다. 0건 표시가 나오면 패키지가 오래된 것입니다. ## 핵심 사용 출처 - Features: 1000건 · root · `C:\AI\sci_voc_bot\data\voc\features\voc_features.csv` - Stress: 1000건 · root · `C:\AI\sci_voc_bot\results\stress_index\voc_stress_score_rebuilt.csv` - STT small: 1000건 · root · `C:\AI\sci_voc_bot\data\voc\stt\voc_whisper_small_results.csv` ## 해석 모바일 콘솔은 분석을 실행하는 곳이 아니라, 로컬에서 생성된 결과값을 확인하는 곳입니다. 따라서 0건으로 보이면 먼저 결과 파일 부재가 아니라 잘못된 snapshot 또는 오래된 배포 패키지를 의심해야 합니다.
결과 해석
건수의 단위를 구분하면 57,619 세그먼트와 2,000 슬롯을 2,000개의 새 음성 파일로 오해하는 문제를 방지할 수 있다.
한계 및 논문 반영 기준
2,000은 원본 음성 건수가 아니라 1,000통화×2화자 후보 슬롯이다.