Tanh (쌍곡선 탄젠트)
Definition
쌍곡선 탄젠트(Tanh) 함수는 신경망에서 널리 사용되는 비선형 활성화 함수입니다. 이 함수는 입력 값을 구간 (-1, 1)으로 압축하여 제로 중 …
Terms tagged with Deep Learning
쌍곡선 탄젠트(Tanh) 함수는 신경망에서 널리 사용되는 비선형 활성화 함수입니다. 이 함수는 입력 값을 구간 (-1, 1)으로 압축하여 제로 중 …
유사도 학습은 유사한 항목이 서로 가깝고 유사하지 않은 항목이 멀리 떨어지도록 입력을 벡터 공간으로 매핑하는 모델을 훈련하는 데 중점을 둡니다. 사이먼 네트워 …
문장 트랜스포머는 전통적인 트랜스포머 모델(예: BERT)의 확장으로, 전체 문장에 대해 의미 있는 밀집 벡터 표현을 생성하도록 미세 조정됩니다. 표준 토큰 수 …
재모수화 트릭은 변분 오토인코더 및 기타 확률적 모델에서 사용되는 근본적인 방법입니다. 이는 무작위 변수를 결정론적 매개변수와 독립적인 확률 변수의 곱으로 표현 …
Pyannote Audio는 화자 diarization 시스템의 개발과 배포를 촉진하도록 설계된 종합적인 툴킷입니다. 오디오 분석 작업을 위한 사전 훈련된 신경 …
전문가들의 곱(Product of Experts, PoE)은 더 간단한 확률 분포들을 결합하여 복잡한 확률 분포를 구성하는 방법론입니다. ‘ …
멀티모달 표현 학습은 텍스트, 이미지, 오디오, …
GAN에서 모드 붕괴는 생성기가 판별기의 약점을 이용하여 가능한 샘플의 좁은 범위만 생성하고 데이터 분포의 다른 모드(mode)를 무시할 때 발생합니다. 이는 …
이 가설은 차원의 저주에도 불구하고 딥러닝이 효과적으로 작동하는 이유를 설명합니다. 이미지와 같은 데이터가 백만 차원의 공간에 존재하더라도, 본질적으로 제한된 …
하이웨이 네트워크는 적응형 게이트를 통합하여 정보 흐름을 제어함으로써 딥러닝의 소멸 그래디언트 문제를 해결하도록 설계되었습니다. LSTM 셀과 유사하게, …
은닉 계층은 이전 계층으로부터 입력을 받아 가중치와 편향을 적용한 후, 활성화 함수를 통해 변환된 데이터를 다음 계층으로 전달하는 뉴런들로 구성됩니다. 이러한 …
AI 하드웨어는 머신러닝 워크로드에 필요한 대규모 병렬 처리를 최적화한 특수 컴퓨팅 장치를 의미합니다. 여기에는 일반적인 병렬 처리를 위한 그래픽 처리 장 …
이 최적화 전략은 GPU 메모리에 맞지 않는 효과적인 배치 크기로 딥러닝 모델을 학습할 수 있게 합니다. 여러 미니 배치에서 그래디언트를 누적하고 수행함으로써 …
게이트드 리커런트 유닛(GRU)은 시계열 데이터의 장기적 의존성을 포착하도록 설계된 특수한 순환 신경망(RNN) 셀입니다. 이는 롱 숏텀 메모리(LSTM) 아키 …
딥러닝과 밀접하게 연관된 피처 학습은 수동 피처 엔지니어링에 의존하는 대신, 모델이 계층적 표현을 직접 학습하도록 합니다. 여러 층(layer)을 통해 원시 입 …
에너지 기반 모델(EBM)은 에너지 함수에서 유도된 비정규화 밀도 함수를 사용하여 입력 데이터에 대한 확률 분포를 정의합니다. 에너지 함수는 데이터 포인트를 실 …
더블 디센트는 전통적인 편향-분산 트레이드오프(bias-variance tradeoff)에 도전하며, 훈련 데이터를 완전히 보간(interpolating) …
도메인 적응은 훈련 데이터와 테스트 데이터가 서로 다른 분포를 가질 때 발생하는 문제를 해결합니다. 레이블이 있는 소스 도메인과 레이블이 없거나 부족한 타겟 도 …
DP-SGD는 훈련 데이터의 프라이버시를 보호하도록 설계된 확률적 경사 하강법(SGD)의 변형입니다. 각 샘플의 경사 기여도를 제한하여 민감도를 줄인 후 가우시 …
BERT는 구글이 개발한 Transformer 기반의 NLP 사전 훈련 기계 학습 기법입니다. 마스킹 언어 모델링과 다음 문장 예측을 사용하여 양방향 표현을 학 …
이 방법은 훈련 중 각 미니 배치 내에서 활성화 값의 평균을 0, 분산을 1로 조정 및 스케일링합니다. 이를 통해 내부 공변량 변화(Internal …
알파칩은 마이크로칩의 구성 요소 배치 및 라우팅을 자동화하고 향상시키기 위해 설계된 특수화된 AI 시스템입니다. 심층 강화학습을 활용하여 시간을 크게 단축합니 …
적대적 공격은 이미지나 텍스트와 같은 입력에 미세한 노이즈를 도입하여 신경망의 취약점을 이용합니다. 이는 모델 출력에 심각한 오류를 유발하며, 모델의 보안성을 …
컴퓨터 비전(CV)은 디지털 이미지, 비디오 및 기타 시각적 입력에서 의미 있는 정보를 추출하도록 컴퓨터를 훈련시키는 인공지능의 한 분야입니다. 여기서는 알고리 …
ReLU는 계산 효율성이 뛰어나고 기울기 소실 문제를 완화할 수 있어 딥러닝 신경망에서 널리 사용됩니다. 수학적으로 f(x) = max(0, x)로 정의되며, …
RNN은 텍스트, 유전체, 손글씨 또는 음성 같은 데이터 시퀀스에서 패턴을 인식하도록 설계되었습니다. 순방향 네트워크와 달리, RNN은 이전 단계의 정보를 포착 …
스킵 연결(skip connections)이라고도 불리는 잔차 연결은 입력을 후속 레이어의 출력에 직접 추가하여 네트워크 전체에 걸쳐 기울기가 흐르도록 합니다. …
LSTM 네트워크는 셀 상태와 세 가지 게이트 메커니즘(입력 게이트, 망각 게이트, 출력 게이트)을 사용하여 표준 RNN에서 흔히 발생하는 기울기 소실 문제를 …
신경망에서 드롭아웃은 각 학습 단계마다 무작위로 선택된 뉴런의 하위 집합을 임시로 제거하여 과적합을 방지합니다. 이는 네트워크가 결합된 상황에서 유용한 견고한 …
활성화 함수는 뉴럴 네트워크에 비선형성을 도입하여 복잡한 패턴과 데이터 내 관계를 학습할 수 있게 합니다. 이러한 함수가 없다면 다층 네트워크는 단순한 선형 회 …
사전 훈련된 모델은 위키피디아나 ImageNet과 같은 방대하고 다양한 데이터셋으로 광범위하게 훈련된 기반 AI 모델입니다. …
디퓨전 기반 모델은 무작위 분포에서 노이즈를 반복적으로 제거하여 새로운 데이터 샘플을 생성하는 생성형 AI의 한 클래스입니다. 이 과정은 가우시안 노이즈를 천천 …
전이 학습은 사전 훈련된 모델을 활용하여 새로운 관련 작업에서 성능을 향상시키고 훈련 시간을 단축합니다. 처음부터 훈련하는 대신, 개발자는 기존 가중치를 미세 …
사전 학습(pre-training)은 딥러닝의 기초 기술로, 모델이 레이블이 없는 방대한 양의 데이터로부터 광범위한 특징과 패턴을 학습하는 과정을 말합니다. …
멀티 헤드 어텐션은 표준 어텐션 메커니즘을 서로 다른 학습된 선형 투영(linear projections)을 사용하여 병렬로 여러 번 실행함으로써 이를 확장합니 …
신경망은 인간의 뇌가 작동하는 방식을 모방하는 과정을 통해 데이터 세트의 숨겨진 관계를 인식하려는 일련의 알고리즘입니다. 이는 입력층, 은닉층, …
대규모 언어 모델(LLM)은 트랜스포머 아키텍처를 기반으로 한 고급 인공지능 시스템으로, 방대한 양의 텍스트 및 코드 데이터셋으로 학습됩니다. …
디퓨전 모델은 데이터에 노이즈를 추가하는 확률적 과정을 역학습하는 생성형 AI 클래스입니다. 신경망이 단계별로 노이즈를 예측하고 제거하도록 훈련시킴으로써, 최종 …
Adam(적응 모멘트 추정)은 심층 신경망 훈련에 널리 사용되는 1계 경사 기반 최적화 알고리즘입니다. 이는 확률적 경사 하강법의 두 가지 확장 버전인 모멘 …
파인튜닝은 이미 대규모 일반 데이터셋으로 훈련된 모델을 가져와 전문화된 데이터셋으로 추가 훈련하는 것을 포함합니다. …
합성곱 신경망(CNN)은 시각적 입력으로부터 특징의 공간적 계층 구조를 자동으로 그리고 적응적으로 학습하도록 설계되었습니다. …
어텐션 메커니즘은 모델이 입력 시퀀스 내의 서로 다른 요소들의 중요도를 동적으로 가중치 부여할 수 있게 합니다. 모든 입력 데이터를 동일하게 취급하는 대신, 어 …