생성형 AI 기반 소셜로봇에서 LLM-as-a-Judge 교차 검증과 MBTI 성격 적응형 상호작용의 효과
Cross-Validation of LLM-as-a-Judge and Effects of MBTI-Adaptive Interaction in Generative AI-Based Social Robots
- 주제(키워드) 소셜로봇 , MBTI , LLM-as-a-Judge , 사회적 실재감 , 로봇 수용도 , HRI
- 주제(DDC) 658.5
- 발행기관 아주대학교 공학대학원
- 지도교수 박재일
- 발행년도 2026
- 학위수여년월 2026. 8
- 학위명 석사
- 학과 및 전공 공학대학원 산업데이터시스템학과
- 실제URI http://www.dcollection.net/handler/ajou/000000036596
- 본문언어 한국어
- 저작권 아주대학교 논문은 저작권에 의해 보호받습니다.
초록/요약
본 연구는 생성형 AI 기반 소셜로봇에서 사용자의 MBTI(T/F) 성향과 로봇 발화 스타일의 일치성이 사회적 실재감과 로봇 수용도에 미치는 효과를 검증한다. 이를 위해 먼저 평가 도구로 도입한 LLM-as-a-Judge 프레임워크가 인간 평가자의 판단을 얼마나 재현하는지부터 교차 검증했다. 투트랙 검증 설계를 적용해, 검증된 프레임워크로 수행한 1 차 분석(2×2 설계, N=400)에서는 성향 일치 조건의 수용도가 불일치 조건보다 유의미하게 높았다. 이 프레임워크를 인간 평가로는 다루기 어려운 규모로 확장해, 16개 MBTI 유형 로봇과 16 개 유형 평가자를 전수 교차시킨 16×16 매트릭스 시뮬레이션 (N=25,600)을 추가로 수행했다. 그 결과 MBTI 4개 선호 지표 중 T/F 차원의 일치가 로봇 수용도를 가장 강하게 예측했고(B=0.261), J/P·S/N·E/I 차원의 일치도 유의한 보조 효과를 보였다. 네 차원은 서로 상호작용 없이 가산적으로 누적되어, 일치하는 차원이 하나 늘 때마다 수용도가 약 0.125 점씩 오르는 용량-반응 관계가 나타났다. 이 결과를 바탕으로 개발 리소스가 제한된 환경에서 어떤 MBTI 차원부터 개인화해야 효율적인지를 안내하는 단계적 설계 가이드라인을 제시한다. 주제어: 소셜로봇, MBTI, LLM-as-a-Judge, 사회적 실재감, 로봇 수용도, 교차 검증, 인간-로봇 상호작용(HRI), 다차원 성격 일치(Multi-dimensional Personality Matching)
more초록/요약
This study examines, in generative AI-based social robots, how congruence between a user's MBTI (T/F) trait and a robot's utterance style affects social presence and robot acceptance. To do this, it first cross-validates how closely the LLM-as-a-Judge framework, introduced as an evaluation tool, reproduces human evaluators' judgments. Applying a two-track validation design, the primary analysis (2×2 design, N=400) conducted with the validated framework found that acceptance was significantly higher under the congruent condition than under the incongruent condition. This validated framework was then scaled to a size beyond what human evaluation could handle, in an additional 16×16 matrix simulation (N=25,600) that exhaustively paired all sixteen MBTI robot types with all sixteen evaluator types. Among the four MBTI preference dimensions, T/F congruence was found to be the strongest predictor of robot acceptance (B=0.261), while congruence on the J/P, S/N, and E/I dimensions also produced significant secondary effects. The four dimensions accumulated additively without interacting with one another, yielding a dose-response relationship in which acceptance rose by about 0.125 points for each additional matched dimension. Based on these findings, the study proposes a staged design guideline indicating which MBTI dimension should be personalized first for efficiency in resource-constrained development settings. Keywords: Social Robot, MBTI, LLM-as-a-Judge, Social Presence, Robot Acceptance, Cross-Validation, Human-Robot Interaction (HRI), Multi-dimensional Personality Matching
more목차
Ⅰ. 서론 1
Ⅱ. 이론적 배경 5
2.1 소셜로봇의 개인화와 페르소나 모델링 5
2.1.1 LLM 도입에 따른 대화 유창성 및 역동성 향상 5
2.1.2 MBTI 기반의 페르소나 설계 5
2.2 MBTI 성격검사 6
2.3 사회적 지지 이론과 지지 일치 가설 7
2.3.1 지지 일치 가설의 HRI 적용 메커니즘 7
2.3.2 지지 일치 가설의 다차원 확장 가능성 8
2.4 사회적 실재감과 시스템 수용성 9
2.4.1 사회적 실재감의 개념과 매개 역할 9
2.4.2 시스템 수용성 모델 9
2.5 HRI 평가 방법론 동향 10
2.5.1 LLM-as-a-Judge 의 개념과 필요성 10
2.5.2 HRI 평가에서의 LLM-as-a-Judge 적용 가능성 10
Ⅲ. 연구 방법 11
3.1 데이터 수집 및 전처리 과정 13
3.2 투 트랙(Two-Track) 검증 설계 15
3.3 실험 시나리오 설계 및 발화 스타일 조작 16
3.3.1 시나리오 생성 파라미터 및 데이터 품질 검증 17
3.4 교차 검증 및 평가 18
3.5 LLM 평가자 페르소나 및 채점 루브릭 20
3.6 16X16 전체 유형 매트릭스 확장 설계 21
Ⅳ. 연구 결과 25
4.1 실험 자극의 유효성 검증(조작 점검) 25
4.2 평가 주체 간 상관관계 및 결과 해석 26
4.3 의사결정 판정 일치도 28
4.4 LLM 시뮬레이터의 한계와 점수 분산 분석 29
4.5 사용자 성향과 로봇 발화 스타일의 일치성 효과(1 차 검증: 2X2) 31
4.5.1 주요 변수 간 상관관계 분석 31
4.5.2 이원 요인분산분석 32
4.5.3 선형혼합효과모형 분석 33
4.5.4 사회적 실재감의 매개효과 검증 34
4.6 다차원 성향 일치 효과 분석(확장 검증: 16X16) 35
4.6.1 확장 데이터셋 기술통계 및 상관분석 35
4.6.2 차원별 일치 효과의 위계: 다중회귀분석 37
4.6.3 복합 일치의 용량 반응 관계 및 선형혼합효과모형 38
4.6.4 차원 간 가산성 검증: 2 차 상호작용 분석 40
4.6.5 효과크기의 재보정: 1 차 검증과 비교 42
4.6.6 사회적 실재감의 매개효과 재검증 43
4.6.7 강건성 검증 44
Ⅴ. 결론 45
5.1 연구 요약 45
5.2 논의 45
5.3 실무적 시사점 46
5.4 연구의 한계 및 향후 과제 47
참고문헌 49
부록(Appendix) 52
Abstract 64

