압축 텐서
term_id: compressed_tensors
Category: basic_concepts
Definition
압축 텐서는 딥러닝에서 사용되는 다차원 배열로, 수치 정밀도(예: float32에서 int8로) 또는 희소성이 감소된 상태입니다. 이 기법은 양자화(quantization) 또는…
Summary
저장 공간과 계산 효율성을 최적화하기 위해 데이터 정밀도나 크기가 줄어든 텐서.
Key Concepts
- 양자화
- 희소성
- 메모리 최적화
- 추론 속도
Use Cases
- 모바일 AI 애플리케이션 배포
- 엣지 디바이스 처리
- 대규모 언어 모델(LLM) 서빙 최적화
Code Example
| |