검색 상세

온디바이스 AI 에너지 최적화를 위한 전력 프로파일링 및 레이어 인지 다중 도메인 저전력 기법

Power Profiling and Layer-Aware Multi-Domain Low-Power Framework for On-Device AI

초록/요약

최근 스마트폰 응용은 생성형 AI, 실시간 통번역, 비전 인식 등 고부하 온디 바이스 AI 워크로드로 빠르게 확장되고 있다. 그러나 모바일 기기는 제한된 배 터리 용량과 열 제약을 가지므로, 온디바이스 AI의 에너지 최적화는 단순히 모 델의 연산량이나 실행 시간을 줄이는 것만으로 해결되기 어렵다. 특히 FLOPs, 지연 시간, NZ-MACs와 같은 대리 지표는 실제 스마트폰의 컴포넌트별 전력 소비와 런타임 하드웨어 상태를 충분히 반영하지 못한다. 본 논문은 온디바이스 AI 에너지 최적화를 위해 두 가지 상호보완적 프레임 워크를 제안한다. 첫 번째 프레임워크는 PMIC 기반 컴포넌트 수준 전력 프로 파일링을 통해, 외부 계측 장비 없이 AI 실행 구간과 컴포넌트별 전력 소비를 연결한다. 이를 통해 ResNet50V2의 양자화 및 pruning 변형을 분석한 결과, FLOPs, 지연 시간, NZ-MACs의 감소가 실제 에너지 효율 향상으로 일관되 게 이어지지 이어지지 않으며, 에너지 효과가 delegate, 정밀도, pruning 위치, 실행 경로에 따라 달라짐을 보인다. 두 번째 프레임워크인 PUMA는 GPU PMU 패턴을 활용하여 레이어 또는 연산 그룹의 실행 특성을 식별하고, GPU, MIF, INT 주파수를 경량하게 보정 한다. Google Pixel 9의 실험에서 PUMA는 기존 거버너 대비 평균 24.23% 의 SoC 전력 절감과 평균 21.48%의 에너지 절감을 달성하였으며, 추론 시간 증가는 평균 4.43%로 제한되었다. 또한 GPU 단독 제어 대비 평균 10.31%의 추가 전력 절감을 제공하고, 모든 워크로드에서 가장 낮은 EDP를 기록하였다. 종합하면, 본 논문은 온디바이스 AI 에너지 최적화가 단순한 모델 경량화 문 제가 아니라, 실제 하드웨어 에너지 관측과 런타임 다중 도메인 제어가 결합되 어야 하는 시스템 수준 최적화 문제임을 보인다. 제안 방법은 대리 지표만으로 드러나지 않는 에너지 병목을 식별하고, 이를 상용 스마트폰의 런타임 제어로 완화할 수 있음을 보인다.

more

초록/요약

As on-device AI workloads become increasingly computationally intensive, energy efficiency in mobile environments cannot be guaranteed simply by reducing operation count or latency. Proxy metrics such as FLOPs, latency, and NZ-MACs do not sufficiently capture component-level power consumption and runtime hardware behavior in real smartphones. The first framework uses PMIC-based component-level power profiling to connect AI execution intervals with component-level power consumption without external measurement equipment. Based on ResNet50V2 quantization and pruning analysis, it shows that reductions in FLOPs, latency, and NZ-MACs do not consistently lead to energy-efficiency gains, as the actual energy impact depends on the delegate, precision, pruning location, and execution path. The second framework, PUMA, identifies the execution characteristics of layers or operation groups using GPU PMU patterns and lightly adjusts the frequencies of the GPU, MIF, and INT domains. Experiments on the Pixel 9 show that PUMA significantly reduces SoC power and energy compared with the default governor, while improving EDP across all workloads with only limited latency overhead. This dissertation frames on-device AI energy optimization as a system-level problem that requires real hardware energy observation and runtime multi-domain control beyond proxy metrics and model compression.

more

목차

1. 서론 1
2. 배경 및 관련 연구 5
2.1. 온디바이스 AI 에너지 최적화의 구조적 문제 5
2.2. 상용 스마트폰에서의 전력 계측 기반과 한계 6
2.3. 모바일 전력 측정 및 에너지 추정 연구 7
2.4. 모바일 DVFS 및 런타임 제어 연구 8
2.5. 기존 연구의 한계 및 설계 요구사항 10
3. PMIC 기반 컴포넌트 수준 비파괴 전력 측정 프레임워크 11
3.1. 프레임워크 개요 및 파이프라인 구성 11
3.2. 전력 레일-컴포넌트 매핑 12
3.3. 런타임 전력 프로파일링 14
3.4. 오프라인 통계적 정렬 및 에너지 추정 15
4. PMIC 기반 전력 측정 프레임워크 검증 및 대리 지표 신뢰성 평가 17
4.1. 실험 환경 및 워크로드 정의 17
4.2. 전력 레일-컴포넌트 매핑 검증 18
4.3. 통계적 가정 및 수렴 검증 20
4.3.1. 반복 실행 안정성 검증 20
4.3.2. PMIC-워크로드 간 위상 비동기성 검증 21
4.3.3. 에너지 추정 수렴 및 Bootstrap 신뢰구간 분석 21
4.3.4. 프로파일러 런타임 오버헤드 및 측정 비용 22
4.4. 제어된 실행 단계에서의 에너지 추정 정확도 검증 23
4.5. 모델 압축 기법의 에너지 영향 분석 24
4.5.1. 대리 지표 신뢰성 평가 25
4.5.2. End-to-End 에너지 효율 분석 27
4.5.3. 레이어/스테이지 수준 에너지 분해 29
4.6. 대리 지표 기반 정적 모델 최적화의 한계와 런타임 제어의 필요성 35
5. PUMA: PMU 기반 다중 도메인 레이어 인식 DVFS 프레임워크 36
5.1. DNN 레이어별 연산 및 전력 특성 분석 36
5.2. 설계 목표 및 전체 구조 38
5.3. 오프라인 단계: 다중 도메인 프로파일링 및 임계값 도출 38
5.4. 온라인 단계: PMU 기반 실시간 페이즈 감지 및 주파수 보정 39
5.4.1. GPU DVFS 보정 알고리즘 40
5.4.2. MIF/INT DVFS 보정 알고리즘 41
6. PUMA 프레임워크 실험 결과 및 분석 42
6.1. 실험 환경 및 평가 지표 42
6.2. SoC 전력 및 추론 지연 비교 43
6.3. Energy-Delay Product 분석 45
6.4. 워크로드별 특성과 DVFS 응답 분석 46
7. 논의 및 결론 48
7.1. 종합 논의 48
7.2. 결론 및 향후 연구 49
참고문헌 51
Abstract 58

more