2026 한국언어청각임상학회 학술대회 · 기조강연

비정형 한국어 음성의
모바일–웹 통합 수집 플랫폼 개발과 다학제적 분석

학술대회 주제 “포괄적 의사소통과 기술 혁신”

윤태진

성신여자대학교 · tyoon@sungshin.ac.kr

강남대학교
2026. 9. 12.(토) 10:30–11:20

발표자료 · tyoon.net

SPEAKER

발표자 소개 — 저는 언어학자입니다

윤태진

Tae-Jin Yoon

성신여자대학교 영어영문학과 교수 · 창의융합대학 학장

Ph.D. Linguistics, University of Illinois at Urbana-Champaign (2007)

학위논문 「문법 접면을 통한 운율 예측 모형」 (Predictive Model of Prosody through Grammatical Interface: A Computational Approach)

믿음

음성학 · 음운론

•말소리에는 규칙·제약·패턴이 있다는 확신

•운율을 발화 조직의 구조로 보는 관점

•대규모 음성 코퍼스 기반 말소리 분석

▸

도구

음성공학 · AI

•한국어 강제정렬기(Korean Forced Aligner) 개발

•HMM·SVM 기계학습, Wav2Vec 2.0 딥러닝 활용 연구

•웹 기반 음성 분석·인식·지각 서비스 구현과 연구 활용

▸

동료

다학제 협업

•하승희(한림대)·소정민(서강대)과 아동 발화 연구 (2021-2024)

•윤지혜·한우재·이승진(한림대) 합류 — 비정형 화자 (2025–2028)

•그 흐름 위에서 수집 플랫폼 개발 진행 중

관점 저는 임상가가 아닙니다 — 오늘 말씀드리는 것은 한 언어학자의 연구가 임상과 만나 온 여정입니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

2

AGENDA

오늘의 이야기 — 한 연구 여정의 네 단계

Part 1

출발점

규칙·제약·패턴,
그리고 도구

6분

▸

Part 2

다학제의 시작

아동 발화 연구
(하승희·소정민)

9분

▸

Part 3

확장

팀의 확장과
수집 플랫폼

13분

▸

Part 4

활용

전생애 사례와
다학제 협업

12분

사례를 관통하는 축 — 전생애(lifespan): 영유아에서 노년·임상까지

영유아

아동

노년

청각임상

ASR·음운론

2026 한국언어청각임상학회 학술대회 · 기조강연

3

여는 질문

우리가 만드는 음성 기술은
누구의 목소리로 학습되었는가?

20~50대

정상 청력

표준어

조용한 스튜디오

— 대부분의 대규모 음성 데이터가 그려 온 ‘평균적 화자’

2026 한국언어청각임상학회 학술대회 · 기조강연

4

THESIS

이 강연의 제안

“비정형 음성 데이터를 모으는 인프라가
포괄적 의사소통을 향한 기술 혁신의 한 출발점이 될 수 있다.”

1

규칙 Rules

말소리에는 언어학적 규칙·제약·패턴이
있다 — 비정형 발화에서도 상당 부분
관찰되며, 해석의 유용한 출발점이 된다.

운율 구조의 위계 — IP · AP · 단어 · 음절

2

도구 Tools

그 규칙은 대규모 실제 발화에서
더 온전히 드러난다 — 음성공학·AI는
그것을 들여다보는 현미경이다.

운율 경계 조건별 핵모음 길이(ms)

3

동료 Team

비정형 화자의 음성은 언어학·공학·
임상이 함께할 때 더 잘 모으고,
더 깊이 해석할 수 있다.

(AI 생성이미지)

2026 한국언어청각임상학회 학술대회 · 기조강연

5

Part 1

출발점 — 말소리에는 문법이 있다

언어학적 규칙·제약·패턴, 그리고 그것을 보는 도구

2026 한국언어청각임상학회 학술대회 · 기조강연

6

PART 1 · 언어학

말소리의 이중성 — 연속적 신호와 범주적 지식

음성학 Phonetics

물리적 · 연속적

•파형·포먼트·지속시간 — 끊김 없이 변하는 물리량

•화자마다, 발화마다 다른 무한한 변이

•측정과 계측의 세계

음운론 Phonology

추상적 · 범주적

•‘불·뿔·풀’ — 삼지적 대립을 가르는 지식

•변이 속에서도 유지되는 대립·규칙·제약

•범주와 문법의 세계

불 · 뿔 · 풀

들어보기 — dear ↔ tear VOT 연속체: 연속적으로 변하는 신호, 범주적으로 들리는 소리

이 이분법을 대규모 실제 발화 데이터가 다시 잇고 있다 — 그리고 그 접점에 임상 음성이 있다.

핵심 임상 평가란 연속적 신호에서 범주적 판단을 내리는 일 — 언어학이 백 년간 해 온 바로 그 작업이다.

2026 한국언어청각임상학회 학술대회 · 기조강연

7

PART 1 · 언어학

규칙 · 제약 · 패턴 — 대규모 데이터에서 확인한 것들

음변화 · 모음

장단 대립의 병합

서울말 ‘눈(雪)–눈(眼)’류 모음 장단
대립이 세대에 걸쳐 소멸하는 과정을
수백 명 규모 발화로 추적.

연령대별 장모음 실현 비율

Kang, Yoon & Han (2015) Laboratory Phonology

음변화 · 자음

어두 폐쇄음 VOT 변화

평음–기식음 VOT 축소가 출생연도와
단어 빈도에 따라 진행 — 개인·어휘
층위까지 내려가는 체계적 패턴.

출생연도별 f0·VOT 궤적

Bang et al. (2018) Journal of Phonetics

운율

운율 구조의 예측

통사·의미 정보로 운율 경계를 예측하는
모형 — 운율은 장식이 아니라 발화를
조직하는 문법이다.

ToBI 성조·경계 레이블 예

Yoon (2007) Ph.D. dissertation, UIUC

핵심 이런 패턴은 소수 화자의 실험 데이터보다 수백~수천 명의 실제 발화에서 훨씬 온전히 드러난다.

2026 한국언어청각임상학회 학술대회 · 기조강연

8

PART 1 · 언어학

도구를 만들다 — 한국어 강제정렬기(Korean Forced Aligner)

발음사전

어휘·발음형
· OOV 처리

▸

자소–음소 변환

한글 → 음소열
유니코드 처리

▸

음운규칙 적용

연음·동화·탈락
표면형 도출

▸

HMM 음향모델

화자 80명
약 100시간 학습

▸

음소·단어 경계

TextGrid 출력

왜 만들었는가 — 시간을 연구로

•음소·단어 경계의 수작업 정렬은 방대한 시간을 소모

•낭독체 문장부터 자동화 — 정렬 시간을 분석·해석 연구로

•연음·동화·탈락 등 음운규칙을 아는 정렬기로 설계

무엇으로 이어졌는가

•낭독체 대규모 코퍼스의 자동 음향 측정 (수십만 어절)

•자연·아동 발화는 아직 한계 — 수동 검수 병행, 협업의 필요

•웹 서비스로 공개 — 한국어 강제음성정렬: http://210.125.93.241:5010

정렬 결과 예시 — TextGrid 4계층(음소·음절·어절·발화)

핵심 공학은 목적이 아니라 현미경이다 — 언어학적 규칙을 보기 위해 도구를 만들었다.

2026 한국언어청각임상학회 학술대회 · 기조강연

9

Part 2

다학제의 시작 — 아동 발화

말소리 습득의 현장에서 언어병리학·공학을 만나다

윤태진

성신여대 — 음성학 · 음운론, 음성공학

+

하승희

한림대 언어병리학 — 아동 말·언어 발달

+

소정민

서강대 — 컴퓨터공학 · 음성인식

이 협업이 밝힌 것 — 사례 셋

아동 · 분절음

어두 폐쇄음
3중 대립의 습득

영유아

양육자 말 레지스터
(가정 종일 녹음)

아동 · 운율

강세구(AP) 성조
패턴의 발달

2026 한국언어청각임상학회 학술대회 · 기조강연

10

PART 2 · 사례 ①

아동 — 어두 폐쇄음 3중 대립의 발달 경로

아동

질문

전사로는 ‘오류’인 시기 — 음향적으로는 이미 대립을 만들고 있는가? (covert contrast)

한국어 단일어 아동 35명(1;6~2;6) vs 성인 10명 · VOT·F0·H1–H2를 선형혼합모형·판별분석으로 비교

발견

•VOT(시간 단서)는 벌써 안정 — 경음 최단·기식음 최장, 아동·성인 간 차이 없음

•F0·H1–H2(주파수 단서)는 발달 중 — 성인과 반대 방향의 F0 패턴, 기식음에서 연령차 최대

•판별분석: 경음 64% > 평음 57% > 기식음 41% — 기식–평음 음향 중첩

VOT — 시간 단서

F0 — 주파수 단서

H1–H2 — 스펙트럼 기울기

Yoon, Kwon, So & Ha (2026). Developmental pathway of the three-way contrasts of word-initial stops in young Korean-acquiring children. First Language, 46(1), 147–171.

임상 포인트 시간 단서(VOT)는 먼저, 주파수 단서(F0·H1–H2)는 나중 — 2세 전후 기식–평음 혼동은 예측 가능한 발달 지점.

2026 한국언어청각임상학회 학술대회 · 기조강연

11

PART 2 · 사례 ②

영유아 — 가정 종일 녹음이 밝힌 것

영유아

모–영아 종일 가정 녹음 — 28쌍 4~21개월(149회) · 11쌍 9~12개월

•왜: 영아어(IDS)는 균질한 한 말투가 아니다 — ‘베이비 레지스터(BR)’와 성인형 레지스터의 혼합

•왜: 실험실 단기 녹음과 평균 비교로는 총량에 가려진 구성, 평균에 가려진 분포를 볼 수 없다

•IDS 총량은 4~21개월 내내 무추세(BF10=0.03) — 그러나 BR 비중은 7개월 이후 낮아짐 (91.7→86.5%)

•점진적 감소가 아니라 7개월 전후의 계단식 변화가 우세 (ΔBIC=−2.69) — 작은 효과, 탐색적

•음향(11쌍): IDS는 F0·HNR↑, 발화 길이↓ — 그러나 분포는 ADS와 크게 중첩, 대부분 단봉 → 연속적 조정

베이비 레지스터 비중 — 선형 vs 7개월 계단 모형

종일 녹음 149회의 BR 비중 — 계단 모형이 근소하게 우세 (탐색적)

한계: 지각 코딩의 연령 기대 효과 분리 불가 (저자 명시)
출처: Developmental Patterns and Shifts in Caregiver Speech Registers in Korean Infants’ Naturalistic Home Environments. Infancy (under Review)

임상 포인트 ‘말을 많이 하라’는 양적 조언을 넘어 무엇이 어떻게 변하는지가 중요 — 그 판별에는 자연스러운 일상 녹음 인프라가 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

12

PART 2 · 사례 ③

아동 — 강세구(AP) 성조 패턴의 습득

아동

AI Hub 아동 코퍼스 3~10세 · ‘거북이는’ 487토큰

•배경: 성인 서울말은 음변화 진행 중 — 평음·기식음 VOT 병합, F0가 대립을 인수 (tonogenesis)

•질문: 입력이 흔들리는 동안 아동은 표면 음성을 복사하는가, 추상적 음운을 추출하는가?

•전 연령에서 LHLH 실현 — 성장곡선분석 3차항 유의, 연령 간 곡선형 차이 없음

•아동 VOT 68.5ms = 현대 성인 수준 (과거 규범 42ms 아님) — 최신 음성 체계를 반영

•그러나 VOT는 F0를 예측 못함 — L→H +4.67반음 상승 유지 → 성조형은 음운적으로 부호화

Yoon, Ha & So (2022) Developmental Patterns of Accentual Phrases in Korean Children’s Speech. Speech Prosody

연령별 F0 곡선 (세미톤) — 관찰된 LHLH

‘거북이는’ — 3~10세 8개 연령 패널 중 7개에서 L–H–L–H (8세만 예외)

임상 포인트 성조형은 3세에 이미 음운적으로 부호화 — 운율 규준의 토대. 그러나 임상 집단은 공개 데이터에 없다.

2026 한국언어청각임상학회 학술대회 · 기조강연

13

PART 2 · 전환

아동에서 특수 화자로 — 두 개의 공동연구 과제

2021–2024 · 일반공동연구

아동 말 데이터베이스 · ASR 말소리 평가

하승희(연구책임) · 윤태진 · 소정민

•임상 현실: 말소리 평가는 청지각 판단 의존 — 객관성·시간·비용의 한계로 조기 선별이 어렵다

•기술 현실: 7세 이하 아동의 음성인식 정확도 약 60% (성인 94%)

•그래서: 일반·말소리장애 아동 3,000명 규모 DB + 아동 특화 발음사전 + ASR 기반 평가 시스템

▸

2025–2028 · 글로벌인문사회융합연구

특수 화자 음성인식 · 의사소통 지원

하승희(연구책임) 외 6인 — 윤지혜·한우재·이승진 합류 · 해외 공동연구(Mark Hasegawa-Johnson, UIUC)

•확인한 것: 같은 문제가 특수 화자 전반에 — 아동·노년·언어장애 화자의 ASR 오류율 70~86%

•노화·신경퇴행(파킨슨병·노화성 난청)의 명료도 저하, 임상 메타데이터 없는 기존 학습 데이터

•그래서: 전문가 주도 수집 + 웹 기반 수집 플랫폼 + 맞춤 ASR(Wav2Vec 2.0 등) + AAC·재활 연계

전환 아동에서 확인한 격차가 특수 화자 전체로 — 이 두 과제의 궤적이 오늘 발표의 3부와 4부다.

2026 한국언어청각임상학회 학술대회 · 기조강연

14

Part 3

비정형 화자로 — 팀의 확장

특수 화자 다학제 과제 (2025–2028) — 첫 과업은 함께 쓰는 데이터 인프라

한림언어청각센터에서 — 공동연구팀

아동 발화 협업에서

•윤태진 — 음성학·음운론

•하승희 — 아동 말·언어 (한림대)

•소정민 — 컴퓨터공학·음성인식 (서강대)

▶

비정형 화자 다학제 팀으로 — 한림대 언어병리학 3인 합류

윤지혜

신경 말·언어장애

한우재

청각학

이승진

음성장애

발달 + 신경 + 청각 + 음성 — 전생애·전 영역을 덮는 임상 전문성

영유아

아동

노년

청각임상

ASR·음운론

2026 한국언어청각임상학회 학술대회 · 기조강연

15

PART 3 · 데이터 격차

특수 화자 음성 데이터 — ‘있다’와 ‘쓸 수 있다’ 사이

AI Hub에는 특수 화자 데이터가 이미 있다 — 문제는 양이 아니라 임상적 쓸모다.

데이터 (AI Hub)규모 · 내용임상·연구 관점의 한계
한국어 아동 음성무소음·소음 낭독 발화 5,000시간낭독 위주 — 규격화된 다양한 음성 샘플 부재 · 장애 음성 부재 · 메타데이터 부재
자유대화 음성 (노인)60세 이상 남녀 1,000명 · 3,000여 시간전사·언어처리용 — 위와 같은 한계 공유 (임상 메타데이터·장애 음성 부재)
난청 검사 음성난청인 5,080명 포함 15,235명 어음청력검사단어 수준 자료에 국한 · 난청의 정도·종류·패턴에 따른 구분 없음
구음장애 음성인식뇌신경·언어청각·후두장애 1,200명 · 5,000시간+정상 발달의 조음오류·정상 노화의 변이 미반영 · 메타데이터 부재

공통 결핍 (계획서 분석) ① 임상 메타데이터를 갖춘 데이터 부족 ② 병리적 변이를 반영한 정교한 라벨링 부재 ③ 기관별 분산·폐쇄적 접근성

핵심 격차의 본질은 데이터의 존재가 아니라 임상적 쓸모 — 전문가가 설계하고 검증한 데이터가 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

16

PART 3 · 플랫폼

왜 플랫폼인가 — 현장의 세 가지 마찰

1

모집과 현장 운영

통제된 환경, 보호자·기관 조율, 취약집단 특수 동의 절차 — 대상자 한 명을 만나기까지의 비용이 크다.

2

품질 유지의 어려움

제각각인 기기·음향 환경·과제 수행 — 녹음마다 조건이 달라져 데이터 변산이 통제되지 않는다.

3

통합 메타데이터 스키마 부재

연령·녹음 조건·과제 유형이 기록되지 않거나 제각각 — 모아도 나중에 쓸 수 없는 데이터가 된다.

핵심 개별 연구실의 노력만으로는 넘기 어려운 구조적 마찰 — 인프라 차원의 해법이 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

17

PART 3 · 플랫폼

설계 원칙 네 가지

1

통합 생태계

음성 수집·메타데이터 구조화·품질관리·분석 준비를 단일 플랫폼으로 — 도구를 이어 붙이지 않는다.

2

대상자 맞춤 UX

아동·노년·청각임상 세 집단에 최적화된 화면 흐름을 하나의 앱에서 동적 분기.

3

메타데이터 우선

모든 녹음에 참여자·과제·기기·환경 정보가 자동 결합 — 완전한 추적성과 감사 이력.

4

즉시 분석 가능

자동 파이프라인이 ASR(WhisperX)·정렬(MFA) 호환 번들을 산출 — 전처리 부담 최소화.

2026 한국언어청각임상학회 학술대회 · 기조강연

18

PART 3 · 플랫폼

시스템 한눈에

모바일 앱

React Native
(Android)

API 서버

Django REST
인증·업로드·메타데이터

음성 분석·시각화

WaveSurfer.js 시각화 ·
ASR(Whisper) · 음향 분석
백엔드 구현 진행 중

저장소

오디오 파일 +
SQLite 메타데이터

웹 관리 콘솔

QC 대시보드
주석·교정·내보내기

▸

▸

▸

모든 구성요소는 표준 API로 통신 — 모듈 교체·확장이 자유로운 구조

참고 기술 스택 이야기는 이 슬라이드가 처음이자 마지막입니다 — 이후는 ‘무엇을 할 수 있는가’로 말씀드립니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

19

PART 3 · 플랫폼

대상자별 라우팅 — 한 앱, 세 가지 경험

아동

발달 음성

•큰 터치 영역·단순한 2단계 흐름

•그림 자극으로 주의 유지

•짧은 과제 단위로 분할

노년

노화 음성

•고대비 화면·큰 활자

•단계별 명확한 지시문

•피로를 고려한 진행 속도·휴식

청각·임상

공동 설계 중

•어음청각검사(KSA) — 단음절·문장 따라말하기

•표준화 녹음 자극 · 쾌적 강도(MCL) 제시

•반응 녹음 저장 → 전사 기반 재채점 지원

공통 UX 마이크 점검 · 프롬프트 미리보기 · 재시도 로직 · 이어 올리기(resumable upload) — 단일 코드베이스에서 동적 분기

2026 한국언어청각임상학회 학술대회 · 기조강연

20

PART 3 · 플랫폼

수집 워크플로 — 동의에서 서버 확인까지 6단계

01

동의

참여자·보호자
전자 동의

▸

02

프로파일

인구정보 입력
집단 라벨링

▸

03

과제 선택

집단별 과제 세트
자동 라우팅

04

녹음

실시간 파형
·시각 타이머

▸

05

업로드

오디오+메타데이터
패키지 전송

▸

06

완료 확인

서버 확인 응답
·실패 시 재시도

Tae-Jin Yoon, Seunghee Ha, Seung Jin Lee, Woojae Han, Ji Hye Yoon, Jungmin So (2026). A Mobile-Web platform for collecting atypical Korean speech across developmental and clinical populations. Proc. Mtgs. Acoust. 60, 060003

핵심 선형·유도형 흐름이 동의부터 서버 동기화까지 데이터 무결성을 보장한다.

2026 한국언어청각임상학회 학술대회 · 기조강연

21

PART 3 · 플랫폼

모바일 앱 실제 화면

① 과제 유형 선택

② 수집 홈

③ 말하기 과제 메뉴

④ 대상자 정보 입력

⑤ 그림 이름대기 (1/30)

핵심 단순함과 충실한 데이터 캡처의 균형 — 현장 연구자가 별도 교육 없이 바로 쓸 수 있는 흐름

2026 한국언어청각임상학회 학술대회 · 기조강연

22

PART 3 · 플랫폼

수집 프로토콜 7종 — 임상 근거 기반 과제

과제내용임상적으로 보는 것
연장 모음 /아/편안한 음도로 모음을 길게 지속최대발성지속시간(MPT) · 호흡 지지 · 발성 안정성
조음교대운동(DDK)/퍼/·/터/·/커/·/퍼터커/ 빠른 반복조음 속도·리듬 · 신경운동 협응(마비말장애·말실행증 선별)
그림 이름대기화면에 제시된 그림의 이름 말하기어휘 인출 · 읽기 부담 없는 단어 수준 조음
문장 읽기짧고 쉬운 문장 낭독읽기 정확도 · 조음 오류 관찰
숫자 세기1~10 자동 발화인지부하 최소의 명료도 기준선 · 다양한 음소 표집
문단 낭독‘가을’ 등 표준 문단 읽기연결발화 흐름 · 운율·호흡군 · 호흡–발성–조음 통합 평가
유도 자발화이야기·그림 설명으로 자연 발화 유도자연 음운변이(동화·탈락) · 실제 운율·구문 다양성

분석·시각화 예 (DDK) http://210.125.93.241:8010/voice-analysis/ddk/ — 데모용 샘플 음성

⇩터터터.wav ⇩퍼터커.wav

임상 포인트 일곱 과제가 함께 호흡–발성–조음–운율–어휘의 전 층위를 덮는다 — 말·언어 평가 문헌에 근거한 구성.

2026 한국언어청각임상학회 학술대회 · 기조강연

23

PART 3 · 플랫폼

품질관리(QC) — 자동 검사 + 사람의 판단

자동 검사 (업로드 즉시)

•파일 무결성 — 포맷(WAV/AAC)·헤더·디코딩 검증

•지속시간·휴리스틱 — 무음 비율 90% 초과, 클리핑 피크 플래그

•메타데이터 검증 — 필수 항목·논리적 범위 강제

•중복 탐지 — 콘텐츠 해시로 중복 제출 자동 거부

수동 검토 큐 (플래그된 녹음)

•전문가 청취 — 재생 인터페이스로 명료도 평가

•주석 — 배경 소음·중단·지시 불이행 태깅

•판정 게이트 — 승인 또는 사유코드와 함께 반려

•상태 추적 — 대기 → 검토 완료 → 분석 준비

업로드

▸

자동 QC

▸

수동 검토 큐

▸

분석 준비 완료

핵심 자동화의 효율과 인간 판단의 신뢰를 결합 — 반려 사유가 다시 현장 프로토콜 개선으로 환류된다.

2026 한국언어청각임상학회 학술대회 · 기조강연

24

PART 3 · 플랫폼

보안 · 윤리 · 동의 — 취약집단 데이터의 전제조건

데이터 보호

•개인식별정보 최소화 — 식별자와 오디오 분리, 익명 세션 ID

•암호화 — 전송 TLS 1.3 · 저장 AES-256, 단말에서 서버까지

•역할 기반 접근 제어(RBAC) — 승인된 연구자만 원자료 접근

•감사 로그 — 모든 접근·수정 이력 기록, 정기 보안 점검

윤리 · 동의

•전자 동의 흐름 내장 — 미성년자는 보호자 동의 필수

•IRB 준수 — 인간 대상 연구 지침에 정합한 프로토콜

•취약집단 보호 — 연령에 맞춘 쉬운 언어의 설명·강화된 보호

•철회권 — 언제든 데이터 삭제를 요청할 수 있는 절차 보장

정합성 개인정보보호법(PIPA)·GDPR 원칙에 맞춘 설계 — 기관·임상 연구에 그대로 탑재 가능한 수준을 목표.

2026 한국언어청각임상학회 학술대회 · 기조강연

25

PART 3 · 플랫폼

최종 산출물 — 분석 준비 완료 번들

AUDIO

16kHz WAV · 잡음 저감

META

참여자·과제·기기 JSON

TEXT

검증 전사 (TextGrid/TXT)

ALIGN

음소·단어 정렬 (MFA)

진행 중

연구자가 받는 것은 파일 더미가 아니라
곧바로 분석 가능한 데이터셋

웹 관리 콘솔 — 메인 ↗

통계 대시보드

녹음 상세 — 파형·ASR 전사·수동 교정

2026 한국언어청각임상학회 학술대회 · 기조강연

26

Part 4

플랫폼이 연 질문들 — 전생애 활용 사례

플랫폼 기반 수집 · 오프라인 수집 청각장애 자료의 다학제 분석

2026 한국언어청각임상학회 학술대회 · 기조강연

27

PART 4 · 사례 ④

노년 — 태블릿 가정 녹음으로 본 음성 노화

노년

건강한 50~81세 207명 · 문단 낭독 · 가정에서 태블릿 녹음

연령↑ 과 함께 증가

HNR · jitter(RAP·PPQ5) · shimmer(APQ3)

연령↑ 과 함께 감소

평균 F0 (여성 견인) · CPP

해석(잠정): HNR↑ · CPP↓ 의 역방향 궤적 — 연장모음 문헌과 배치, 보상적 과내전(hyperadduction) 가능성

Divergent HNR and CPP Aging Trajectories in Korean Connected Speech — Journal of Voice (Accepted)

가장 연령 민감한 6개 지표의 궤적

선형혼합모형 예측·95% CI — 윗줄 4개는 증가, F0·CPP는 감소

임상 포인트 정상 노화 vs 병리 감별을 위한 한국어 연결발화 규준의 토대 — 그리고 가정 태블릿 녹음의 타당성 증거 (재검사 신뢰도·기기 효과는 향후 과제).

2026 한국언어청각임상학회 학술대회 · 기조강연

28

PART 4 · 사례 ⑤

청각임상 — 왜 문장은 되고 단어는 안 되는가

청각임상

Whisper ASR 채점 vs 청각사 4인 합의 (일치도 %)

0

25

50

75

100

인간 평정자 간 수준 (κ = 0.97)

94.0%

κ = 0.88

문장 (SRS)

60.3%

κ = 0.27

단음절 단어 (WRS)

65세 이상 난청 노년층 31명 · 한국 표준 어음청각검사

모델별 인식 정확도·CER (SRS / WRS) — LoRA 적응이 단음절(WRS)에서 큰 폭으로 개선

•단음절은 체계적 과소 채점 — 편향 −35.0점, 정상 청력도 난청으로 오분류될 크기

•LoRA 적응 시 단어 80.9% · 편향 +0.2점 — 단, 고정 어휘·탐색적, 전향적 검증 필요

Why Sentences Succeed and Words Fail: Automatic Speech Recognition for Korean Speech Audiometry in Older Adults with Hearing Loss (under Review)

핵심 제목 그대로 — 문장은 성공하고 단어는 실패한다(Why Sentences Succeed and Words Fail).

2026 한국언어청각임상학회 학술대회 · 기조강연

29

PART 4 · 사례 ⑤

그래서 임상에서는 — 되는 것, 아직인 것, 새로 열리는 것

청각임상

지금 가능

문장 검사(SRS) 채점

ASR과 청각사가 100번 중 94번 같은 판정 — 사람을 대체하는 게 아니라,
검사자마다 점수가 달라지는 문제를 줄이는 ‘이중 확인’ 보조로 쓸 만하다.

아직 불가

단어 검사(WRS) 채점

맞게 말한 답도 틀렸다고 판정해 점수를 평균 35점 깎는다 — 정상 청력도
난청처럼 보일 수 있어, 검사 어휘에 맞춘 별도 학습 없이는 쓸 수 없다.

새 가능성

반응이 남는 검사

지금 검사는 최종 점수만 남지만, 녹음·전사 기반 검사는 환자의 실제 반응이
남는다 — 다시 채점하고, 판정 이견을 검토하고, 어떤 음소를 틀리는지 볼 수 있다.

임상 포인트 자동 채점의 가치는 사람의 대체가 아니라 ‘기록의 회복’ — 점수만 남던 검사에서, 반응까지 남는 검사로.

2026 한국언어청각임상학회 학술대회 · 기조강연

30

PART 4 · 사례 ⑥

겹받침 — 한국어에서 가장 까다로운 받침

ASR·음운론

또 하나의 협업 — 이번에는 언어학자들끼리: 윤태진(성신여대) · 권수현(경희대) · 한정임(건국대) · 오수진(서울대), 음성학·음운론

겹받침(자음군 받침) — 받침에 자음이 두 개

닭 → [닥]

자음군 단순화 (하나만 소리 남)

닭이 → [달기]

재음절화 (모음 앞에서는 둘 다 살아남)

읽는 → [잉는]

비음동화

밝히고 → [발키고]

기식음 병합

같은 받침이 환경에 따라 네 갈래로 실현 — 음운 규칙들의 교차점

Whisper에게도 가장 어려운 지점

전체 종성 오류율

2.67 ~ 4.53%

겹받침 오류율 — 훨씬 높다

2.94 ~ 6.93%

NIKL 자발화 54,536발화 · Whisper 4종 · 서울 vs 경상

방언 효과: 서울이 경상보다 낮으나 격차는 large-v3에서 소멸 — ‘규모’가 방언 격차는 줄여도 겹받침 오류는 남긴다.

Tae-Jin Yoon, Soohyun Kwon, and Jeong-Im Han. (2026) Whisper ASR Errors in Korean Complex Coda Recognition: Syllable Coda Phonotactics and Dialectal Variation. Phonetics and Speech Sciences 18(1): 55-63.

핵심 오류는 겹받침이라는 음운 구조에 몰려 있다 — 그리고 사람도 같은 곳에서 흔들린다 (다음 슬라이드).

2026 한국언어청각임상학회 학술대회 · 기조강연

31

PART 4 · 사례 ⑥

사람도 같은 곳에서 흔들린다 — 실패에도 문법이 있다

ASR·음운론

Whisper 오류의 위계 (상대 빈도 모식도)

C2 탈락 (읽고→‘일고’로 받아씀)

우세

C1 탈락 (닭이→‘다기’로 받아씀)

기식음 병합 (잃고→‘일코’로 받아씀)

비음동화 (읽는→‘잉는’으로 받아씀)

거의 0

재음절화 (읽어서→‘일거서’로 받아씀)

거의 0

음운론적 동기 오류 23~41% — 모델·방언 불문 일관. 오류는 무작위 잡음이 아니라 음운 문법에 뿌리를 둔 체계적 실패 지점.

인간 화자의 겹받침 — 진행 중인 음변화

lp 밟고 · lk 읽고 · lm 굶고

/lk/의 ‘일꼬’형(C1 보존)이 1970년 이후 출생에서 급증 — 어간별 37~100% 변이 (NIKL 2,739명 코퍼스)

Analogical change in progress in stem-final consonant cluster simplification: Evidence from Seoul and Gyeongsang Korean (submitted)

핵심 ASR가 넘어지는 곳과 사람이 변하는 곳이 겹친다 — 이 지도를 읽는 데 각 분야의 도메인 지식이 필요하다.

2026 한국언어청각임상학회 학술대회 · 기조강연

32

PART 4 · 종합

AI 시대에 임상가·언어학자가 필요한 이유

규모(scale)가 해결한 것

•정형 성인 발화의 전사 정확도

•방언 간 성능 격차 (large-v3에서 소멸)

•잡음·화자 변이에 대한 일반적 강건성

규모가 해결하지 못한 것

•고립 단음절 채점 (κ=0.27) — 규모를 키워도 정체, 과제를 아는 적응이 필요

•겹받침의 음운론적 오류 — 큰 모델에도 잔존, 인간 화자의 변이와 겹침

•아동·노년·임상 음성과 그 임상 메타데이터

•취약집단을 위한 과제 설계와 UX

“실패의 구조를 아는 사람이 함께할 때, 더 나은 도구가 만들어진다.”

2026 한국언어청각임상학회 학술대회 · 기조강연

33

PART 4 · 현장

한계를 분명히 — 그리고 각각의 대응

현재의 한계대응·맥락
Android 전용 (iOS 미지원)국내 아동·노년·기관 보급 기기 시장에 적합 — iOS 포팅은 로드맵 항목
진단 등 메타데이터의 자기보고 의존입력 제약·논리 교차 검증(연령 vs 집단)으로 명백한 오류 차단
통제되지 않는 가정 녹음 환경(소음 변이)단말 실시간 진폭·SNR 점검 + 서버 자동 QC로 즉시 플래그
종단 추적 기능 미비출처 있는 익명 ID 체계 — 향후 세션 연결·종단 연구의 기반
청각·임상 프로토콜 미구현팀 내 청각학·언어병리 전문가와 공동 설계 진행 중

태도 한계의 명시가 신뢰의 근거다 — 이 목록이 곧 우리의 연구 로드맵이다.

2026 한국언어청각임상학회 학술대회 · 기조강연

34

PART 4 · 현장

로드맵 — 다음 단계 네 가지

1

음성 분석·시각화 완성

백엔드에서 구현 진행 중 — ASR 전사에 음향 분석·시각화를 더해 분석 파이프라인 완결

▸

2

iOS·크로스플랫폼

React Native 코드베이스의 iOS 포팅 — 임상 현장의 기기 다양성 수용

▸

3

종단 데이터 연결

세션 간 연결로 발달·퇴행의 시계열 추적 — 전생애 연구의 핵심 기능

▸

4

공개 API·오픈소스

메타데이터 스키마 · QC · 내보내기 도구 공개 — 연구 생태계로

지향 도구가 아니라 공동의 기반(foundation) — 다른 연구자들이 그 위에 자신의 프로토콜을 세울 수 있도록.

2026 한국언어청각임상학회 학술대회 · 기조강연

35

맺음말

1

말소리에는 규칙이 있다 — 비정형 발화에도.

2

그 규칙은 포괄적 데이터에서 비로소 온전히 보인다 — 인프라가 그 토대다.

3

전생애적 지원은 전생애 데이터와 다학제 협업을 요구한다.

“포괄적 의사소통과 기술 혁신” — 그 접점에, 함께 만드는 데이터 인프라가 있습니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

36

감사합니다

Q&A · 토론

Contact

tyoon@sungshin.ac.kr

웹 콘솔

Open Source

github.com/exphon/voice-recorder-app · /voice_project

공동연구: 하승희 · 윤지혜 · 한우재 · 이승진(한림대) · 소정민(서강대) · 권수현(경희대) · 한정임(건국대) 외 여러 선생님들께 감사드립니다.

2026 한국언어청각임상학회 학술대회 · 기조강연

37

1 / 37
← → Space 이전 · 다음
Home / End 처음 · 끝
숫자 + Enter 해당 장으로
N 발표자 노트
O 전체 개요
F 전체화면
P 인쇄 → PDF 저장
그림 클릭 확대 보기 · 바깥 클릭으로 닫기
스마트폰 좌우로 밀기 · 화면 좌/우 탭 · 쪽수 탭 = 노트
? 이 도움말