텍스트 생성 추론
Definition
텍스트 생성 추론(TGI)은 낮은 지연 시간과 높은 처리량을 위해 대규모 언어 모델(LLM)을 서빙하도록 설계된 전용 소프트웨어 프레임워크입니다. 이 프레임워크 …
Terms tagged with Deployment
텍스트 생성 추론(TGI)은 낮은 지연 시간과 높은 처리량을 위해 대규모 언어 모델(LLM)을 서빙하도록 설계된 전용 소프트웨어 프레임워크입니다. 이 프레임워크 …
가지치기는 신경망에서 출력 정확도에 거의 기여하지 않는 뉴런, 연결 또는 필터를 식별하고 제거하는 과정입니다. 이러한 중복 요소를 제거함으로써 모델의 파라미터 …
인텔이 개발한 OpenVINO(Open Visual Inference and Neural network Optimization) …
이 범주에는 모델의 용량을 줄이면서도 성능을 유지하는 것을 목표로 하는 가지치기(Pruning), 양자화(Quantization), 지식 증류(Knowledge …
AI 엔지니어링 맥락에서 마이크로서비스는 데이터 전처리, 모델 추론, 결과 저장 등 AI 파이프라인의 서로 다른 구성 요소를 독립적으로 개발, 확장 및 유지보수 …
MLOps는 조직이 프로덕션 환경에서 머신러닝 모델을 신뢰성 있고 효율적으로 배포하고 유지할 수 있도록 합니다. 여기에는 데이터 및 모델의 버전 관리, …
로컬 LLM 실행은 PC, 맥, 로컬 서버 등 소비자용 하드웨어에 오픈 웨이트 모델을 직접 배포하는 것을 의미합니다. 이 방식은 제3자 API 제공업체에 대한 …
‘ラストマイル’問題は、既存のインフラストラクチャとの統合、低レイテンシ推論の確保、エッジコンピューティングへの対応など、モデルを生産環境にデプロイする際 …
가드레일(Guardrails)은 AI 애플리케이션, 특히 대형 언어 모델에 통합된 소프트웨어 제어 및 정책 집행 레이어의 집합을 의미합니다. 이는 모델이 안전하 …
GPT OSS는 일반적으로 독점적인 생성 사전 훈련 변환기(Generative Pre-trained Transformer) 모델의 오픈소스 대안이나 파생물을 나 …
이 관행은 스마트폰, IoT 센서 또는 임베디드 시스템과 같은 하드웨어에 훈련된 AI 모델을 직접 배포하는 것을 포함합니다. …
엣지 컴퓨팅(Edge Computing)은 사물인터넷(IoT) 장치, 센서 또는 로컬 게이트웨이 등 데이터가 생성되는 근처에서 데이터를 처리함으로써 클라우드 중 …
디퓨전 단일 파일(Diffusion Single File)은 머신러닝 모델, 특히 디퓨전 모델의 패키징 전략을 의미합니다. 이 방식은 바이너리 가중치, 하이퍼파 …
예측 또는 스코어링이라고도 하는 추론은 모델 학습 단계 이후에 발생합니다. 알고리즘은 입력 특징을 받아 내부 구조(신경망의 가중치 등)를 통해 처리합니다. …
AI 공학에서의 테스트는 편향성, 오류 및 견고성 문제를 식별하기 위해 다양한 데이터셋에 대해 모델을 엄격하게 평가하는 것을 포함합니다. 여기에는 코드 구성 요 …
양자화는 고정소수점 수(예: FP32)를 더 낮은 정밀도의 형식(예: INT8 또는 FP16)으로 변환합니다. …
도커는 개발자가 애플리케이션과 모든 의존성을 소프트웨어 개발을 위한 표준화된 단위인 컨테이너로 패키징할 수 있게 합니다. 이러한 컨테이너는 소프트웨어를 환경으로 …
인공지능에서 실시간은 시스템이 최소한의 지연(latency)으로 입력을 처리하고 출력을 생성하는 능력을 나타내며, 종종 밀리초 단위로 이루어집니다. 이는 자율 …
저비용 AI는 효율성에 중점을 두어 머신러닝과 관련된 진입 장벽 및 운영 비용을 줄이는 것을 목표로 합니다. 여기에는 모델 압축, 양자화, 경량화 등의 기법이 …
전통적으로 수송 수단을 의미하지만, AI 용어에서는 ‘비클’이 모바일 앱, …
클라우드 컴퓨팅은 AI 워크로드를 위한 확장 가능한 인프라를 제공하며, 개발자가 물리적 데이터 센터를 유지보수하지 않고도 강력한 GPU와 스토리지에 접근할 수 …
추론은 완성된 모델을 사용하여 보지 못한 데이터에 대해 결정을 내리거나 예측을 수행하는 배포 단계를 의미합니다. 가중치를 업데이트하는 훈련과 달리, …