압축 텐서

term_id: compressed_tensors

Category: basic_concepts

Definition

압축 텐서는 딥러닝에서 사용되는 다차원 배열로, 수치 정밀도(예: float32에서 int8로) 또는 희소성이 감소된 상태입니다. 이 기법은 양자화(quantization) 또는…

Summary

저장 공간과 계산 효율성을 최적화하기 위해 데이터 정밀도나 크기가 줄어든 텐서.

Key Concepts

  • 양자화
  • 희소성
  • 메모리 최적화
  • 추론 속도

Use Cases

  • 모바일 AI 애플리케이션 배포
  • 엣지 디바이스 처리
  • 대규모 언어 모델(LLM) 서빙 최적화

Code Example

1
2
3
4
import torch
# Example of converting a tensor to half precision
x = torch.randn(10, 10)
x_compressed = x.half()