검색 상세

ViT 가속을 위한 수직 절단형 디지털 SRAM CIM 구조

초록/요약

비전 트랜스포머(Vision Transformer, ViT)는 대규모 이미지 인식 분야에서 최고 수준의 정확도를 달성하고 있으나, 방대한 곱셈-누산(MAC) 연산량과 입력 토큰 수(N)의 증가에 따라 연산 및 메모리 요구량이 제곱 비례로 증가하는 2차 복잡도 (Quadratic Complexity, O(N2)) 문제를 갖는다. 이러한 특성은 자원이 제한된 온디 바이스(On-device) 환경에서 고속 연산을 방해할 뿐만 아니라, 잦은 데이터 액세 스로 인한 대규모 전력 소비를 유발하여 온디바이스 구동을 저해하는 주요 원인이 된다. 특히 하드웨어 측면에서는 프로세서와 메모리 간의 대역폭 제한으로 인해 성 능이 병목되는 메모리 벽(Memory Wall) 문제가 심화된다. 이를 완화하기 위해 데이터가 저장된 메모리 내부에서 연산을 수행하는 컴퓨팅 인 메모리(Computing-in-Memory, CIM) 구조가 제안되었으나, 기존 CIM 가속기 들은 주로 저정밀도 고정소수점 연산에 최적화되어 있어 ViT의 정확도 유지에 필 수적인 BF16(Bfloat16) 부동소수점 연산을 효율적으로 지원하지 못한다. 본 논문에 서는 에너지 효율적인 BF16 ViT 추론을 위한 버림 기반 디지털 SRAM CIM 가속 기인 TDCIM(Truncation-based Digital CIM)을 제안한다. TDCIM은 다음과 같은 세 가지 핵심 기술을 도입한다. 1. 그룹별 사전 정렬(Group-wise Pre-aligning) 기법: 런타임 지수 정렬 과정을 제거하여 BF16 가수부 연산 복잡도를 INT8 수준으로 절감한다. 2. 지수 인식 스킵(EAS) 메커니즘: 지수 값을 바탕으로 결과에 미치는 영향이 적은 입력 그룹을 제거하여, 불필요한 사전 정렬 및 MAC 연산을 방지한다. 3. 수직 절단 (Vertical-cut Truncation) 기술: TMAC 스케줄러의 사이클 단위 제어를 통해 추가적인 근사 로직 없이 가수부 곱셈에서 하위 부분곱(Partial Product)을 제거한다. 28nm 공정에서 구현된 TDCIM은 ViT-B/16 모델 기준, Top-1 정확도 하락을 1% 미만으로 유지하면서 연산 사이클을 70.44% 단축하였으며, 에너지 효율을 200.81% 향상시켰다.

more

초록/요약

Vision Transformers (ViTs) achieve state-of-the-art accuracy in large-scale image recognition, but their massive MAC workload and quadratic complexity hinder energy-efficient on-device deployment. While Computing-in-Memory (CIM) architectures alleviate the memory wall, existing CIM accelerators are largely optimized for low-precision fixed-point arithmetic and cannot efficiently support the BF16 operations needed to preserve ViT accuracy. This paper presents TDCIM, a truncation-based digital SRAM CIM accelerator for energy-efficient BF16 ViT inference. TDCIM incorporates three techniques: 1) a group-wise pre-aligning scheme that removes runtime exponent alignment and reduces BF16 mantissa computation complexity to near-INT8 levels; 2) an exponent-aware input skipping (EAS) mechanism that skips input groups with negligible impact based on exponent values, thereby avoiding unnecessary pre-aligning and MAC operations; and 3) a verticalcut truncation technique, implemented through cycle-level control by the TMAC scheduler, that removes the least significant partial products in mantissa multiplication without additional approximate logic. Implemented in a 28 nm process, TDCIM reduces operation cycles by 70.44% and improves energy efficiency by 200.81% on the ViT-B/16 model, while maintaining less than 1% Top-1 accuracy degradation.

more

목차

Ⅰ 서론 1
1 연구 배경 및 동기 3
1.1 부동소수점 MAC 연산 기술적 난제 3
1.2 ViT에서의 지수 기반 생략 가능성 분석 4
1.3 가수부 곱셈 내 최적화 경계 분석 6
1.4 CIM 내 하위 비트 최적화 선행 연구 사례 7
Ⅱ 본론 10
1 제안하는 TDCIM 가속기 10
1.1 TDCIM 가속기 전체 구조 10
1.2 EAS 캐시 메모리 및 사전 정렬 유닛 13
1.3 CIM 어레이 및 비트 단위 곱셈기 15
1.4 수직 절단형 TMAC 연산 17
2 구현 및 실험 결과 22
2.1 세부 구현 사양 22
2.2 입력 그룹 생략 및 하위 비트 절단에 따른 영향 분석 23
2.3 에너지 효율, 처리량 및 면적 효율 26
2.4 선행 연구 대비 비교 28
Ⅲ 결론 30
참고 문헌 32
ABSTRACT 36

more