텍스트-이미지 생성 (T2I)
Definition
텍스트-이미지(T2I) 생성은 확산 모델(Diffusion Models)이나 생성 적대 신경망(GANs)과 같은 딥러닝 모델을 사용하여 자연어 프롬프트 기반의 …
Terms tagged with Computer Vision
텍스트-이미지(T2I) 생성은 확산 모델(Diffusion Models)이나 생성 적대 신경망(GANs)과 같은 딥러닝 모델을 사용하여 자연어 프롬프트 기반의 …
유사도 학습은 유사한 항목이 서로 가깝고 유사하지 않은 항목이 멀리 떨어지도록 입력을 벡터 공간으로 매핑하는 모델을 훈련하는 데 중점을 둡니다. 사이먼 네트워 …
Sam3는 SAM(Segment Anything Model)처럼 널리 알려진 표준 공개 AI 용어는 아닙니다. 이는 서드파티 버전, SAM 2의 오타, 또는 기 …
Sam3 Video는 고급 세그멘테이션 모델(메타의 Segment Anything Model의 가설적이거나 특정 버전일 수 있음)을 비디오 데이터에 적용하는 것 …
표현 붕괴는 특히 자기지도 대조 학습 프레임워크에서 신경망이 모든 입력 데이터 포인트를 동일한 고정 출력 벡터로 매핑하도록 학습할 때 발생합니다. 이는 모델이 …
광학 문자 인식(OCR)은 디지털 이미지 내의 텍스트를 식별하기 위해 이미지 처리 및 패턴 인식 알고리즘을 사용합니다. …
객체 탐지는 단순히 이미지에 어떤 객체가 있는지 판별하는 이미지 분류를 넘어, 해당 객체가 어디에 위치해 있는지도 파악합니다. …
마스크 생성은 특정 작업 중 데이터 세트의 어떤 요소가 표시되거나 활성화될지를 결정하는 공간적 또는 시간적 마스크를 생성하는 것을 포함합니다. …
LocateAnything는 자연어 프롬프트나 일반 사전 지식을 기반으로 이미지에서 객체를 감지하고 분할할 수 있는 다목적 컴퓨터 비전 프레임워크입니다. 사전 …
지능형 단어 인식은 신경망에 의해 구동되는 고급 광학 문자 인식(OCR) 기술을 의미합니다. 이는 단순한 패턴 매칭을 넘어 문맥을 이해하고, 노이즈가 있는 이미 …
이미지 투 이미지(Image To Image, I2I)는 GAN이나 디퓨전 모델과 같은 딥러닝 모델을 사용하여 한 이미지를 다른 이미지로 변환하는 작업을 의미합 …
이미지-이미지(I2I) 변환은 GAN이나 디퓨전 모델과 같은 딥러닝 모델을 사용하여 소스 도메인의 픽셀을 타겟 도메인으로 매핑합니다. 이를 통해 스타일 전송, …
방향성 변위 히스토그램(HOD)은 HOG의 개념을 시간 차원으로 확장한 비디오 분석을 위한 특징 추출 방법입니다. 이는 내부의 광류 벡터에 대해 히스토그램을 계 …
구글 클립스는 구글이 개발한 소비자 전자 제품으로, 기기 내 머신러닝을 사용하여 얼굴이나 애완동물 등 흥미로운 장면과 피사체를 식별하고 자동으로 사진을 촬영했습 …
구글(Google)에서 개발된 EfficientNet은 네트워크의 깊이(depth), 너비(width), 입력 이미지 해상도(resolution) …
이 용어는 비디오 생성을 위해 설계된 Hugging Face Diffusers 라이브러리의 특정 구현을 지칭합니다. 이는 잠재 비디오 디퓨전 모델인 Stable …
디엘라(Diella)는 해상도를 높이거나 노이즈를 제거하여 이미지 품질을 향상시키는 데 최적화된 특정 신경망 모델을 지칭합니다. 이러한 아키텍처는 일반적으로 고 …
딥러닝 안티앨리어싱은 고주파 신호가 불충분한 샘플링률로 샘플링될 때 발생하는 앨리어싱 아티팩트를 완화하기 위해 신경망을 활용하는 방법을 지칭합니다. 컴퓨터 그래 …
Flickr30K Captions은 시각적 내용을 설명하는 다섯 개의 고유한 영어 문장으로 주석이 달린 31,783장의 이미지로 구성된 널리 사용되는 벤치마크 …
대조적 언어-이미지 사전 학습(CLIP)은 인터넷상의 이미지와 해당 캡션으로 훈련된 신경망 아키텍처입니다. 이 방법은 대조적 목적 함수를 사용하여 이미지와 텍스 …
CAM은 입력 이미지 위에 오버레이되는 히트맵을 생성하여, 모델이 특정 클래스 레이블을 결정하는 데 가장 많이 기여한 픽셀을 보여줍니다. 이는 최종 컨볼루션 레 …
투 스테이지 아키텍처는 복잡한 작업을 두 개의 별도 단계로 나누며, 일반적으로 탐지(Detection) 이후 분류(Classification) 또는 정 …
파인그레인드 분석은 단순히 주요 클래스를 식별하는 것을 넘어, 하위 클래스 수준에서 객체나 개념을 식별하고 범주화하는 것을 포함합니다. 예를 들어, …
AI에서 ‘비주얼’이라는 용어는 주로 컴퓨터 비전을 지칭하며, 이는 기계가 디지털 이미지, 비디오 및 기타 시각적 입력에서 의미 있는 정보 …
AI 지각은 원시 센서 데이터를 상위 추론 모듈에서 처리할 수 있는 의미 있는 정보로 변환하는 것을 포함합니다. 여기에는 시각적 장면을 해석하기 위한 컴퓨터 비 …
매칭은 서로 다른 데이터 엔티티 간의 관계를 확립하기 위해 머신러닝에서 사용되는 중요한 기술입니다. 컴퓨터 비전에서는 특징 매칭을 통해 이미지 간 대응 지점을 …
컴퓨터 비전 및 로봇공학에서 모션은 시각 데이터나 물리적 시스템 내의 움직임을 감지하고 분석하는 것을 의미합니다. 광학 유동(Optical Flow)과 같은 알 …
탐지는 AI 모델이 관심 대상의 존재 여부와 위치를 식별하는 컴퓨터 비전 및 신호 처리의 핵심 작업입니다. 레이블을 할당하는 분류(Classification) …