Unsloth
Definition
Unsloth는 대규모 언어 모델(LLM)의 파인튜닝 및 배포를 최적화하도록 설계된 전용 도구입니다. 표준 PyTorch 연산을 대체하여 상당한 속도 향상과 메 …
Terms tagged with LLM
Unsloth는 대규모 언어 모델(LLM)의 파인튜닝 및 배포를 최적화하도록 설계된 전용 도구입니다. 표준 PyTorch 연산을 대체하여 상당한 속도 향상과 메 …
토큰 맥싱은 모델의 컨텍스트 윈도우 전체 용량을 활용하거나, 더 나은 성능을 위해 토큰의 의미 밀도를 최적화하기 위해 입력을 신중하게 구성하는 과정을 포함합니 …
주로 대규모 언어 모델(LLM)에서 사용되는 이 기법은 샘플링을 통해 프롬프트에 대해 다양한 응답을 여러 개 생성함으로써 정확도를 향상시킵니다. 탐욕적 디코 …
流暢さを重視する標準的な生成モデルとは異なり、推論モデルは数学、コーディング、論理パズルなどの多段階タスクにおける正確性を優先します。これらはしばしば思考連 …
AIにおけるリフレクションは、モデルが最終決定を下す前に、自身の生成プロセスや出力を評価するパラダイムです。これには、論理的整合性、事実の正確性、または安全性への準拠などを確認す …
Pythia는 EleutherAI가 만든 오픈소스 대규모 언어 모델(LLM) 시리즈로, 신경망의 해석 가능성과 동작을 연구하는 것을 목표로 합니다. 이 스위트에 …
프롬프트 튜닝은 사전 훈련된 언어 모델의 입력 레이어에 학습 가능한 소프트 프롬프트(연속 벡터)를 추가하고, 기본 모델 파라미터는 고정된 상태로 유지합니다. …
Phi는 ‘Teaching-Learning Paradigm(교수-학습 패러다임)‘을 기반으로 한 파운데이션 모델을 줄인 이름으로, 마이크로 …
신경망 스케일링 법칙은 모델의 성능과 규모(데이터셋 크기, 파라미터 수, 컴퓨팅 예산 포함) 사이의 예측 가능한 멱법칙 관계를 설명합니다. …
미스트랄은 프랑스 스타트업 미스트랄 AI(Mistral AI)가 만든 강력한 오픈 웨이트 LLM(대규모 언어 모델) 패밀리를 지칭합니다. Mistral 7B …
허위 정보는 해를 끼치거나 기만하려는 고의적인 의도 없이 공유되는 거짓 또는 오해의 소지가 있는 정보를 지칭합니다. 이는 의도적으로 조작된 정보인 ‘ …
2024년 8월 출시된 Llama 3.1은 방대한 4050억 파라미터 모델을 비롯해 작은 8B 및 70B 변형 모델을 포함하여 Llama 패밀리 규모를 확대했습 …
2023년 7월 메타 AI에서 출시된 라마 2는 오픈 가중치 대규모 언어 모델의 중요한 진화를 나타냅니다. 70억 파라미터부터 700억 파라미터에 이르기까지 사 …
2024년 4월 소개된 라마 3은 라마 2의 성공을 바탕으로 성능과 능력에서 상당한 향상을 이루었습니다. 이 모델 패밀리는 80억 파라미터 및 700 …
라마(Large Language Model Meta AI)는 메타에서 출시한 일련의 기반 대규모 언어 모델입니다. …
Kimi K2는 Moonshot AI의 대형 언어 모델 시리즈에서 중요한 진전을 나타내는 모델입니다. 복잡한 논리적 추론, 수학 문제 해결, 그리고 매우 긴 문 …
Kimi K25는 Moonshot AI가 생산하는 Kimi 모델 패밀리 내의 고급 버전입니다. 이전 버전인 Kimi K2의 기반 위에 구축되어, 추론 속 …
명령 따름은 대규모 언어 모델 및 기타 AI 시스템이 프롬프트 내의 미묘한 인간 지시를 이해하고 명시적 제약을 준수하는 능력을 의미합니다. …
가드레일(Guardrails)은 AI 애플리케이션, 특히 대형 언어 모델에 통합된 소프트웨어 제어 및 정책 집행 레이어의 집합을 의미합니다. 이는 모델이 안전하 …
‘GLM MoE DSA’라는 단일 표준 용어는 존재하지 않습니다. 그러나 이는 GLM(특정 대규모 언어 모델 아키텍처), MoE(전문가 혼 …
통계 모델링에서 GLM은 일반화 선형 모델(Generalized Linear Models)의 약자로, 정규분포 이외의 오차 분포 모델을 허용하도록 선형 회귀를 …
GPT-5.6은 오픈AI의 대형 언어 모델 계보상에서 추측되거나 향후 출시될 버전을 지칭합니다. 구체적인 세부 사항은 개발 일정에 따라 다를 수 있으나, …
팔콘은 기술혁신연구소(TII)에서 제작한 강력한 대규모 언어 모델(LLM) 시리즈를 지칭합니다. Falcon-40B 및 Falcon-180B와 같은 모델들은 독 …
이글(Eagle)은 대규모 언어 모델(Large Language Models) 영역에서 특정 아키텍처 및 엔지니어링 프레임워크를 나타내며, 주로 훈련 효율성과 …
DeepSeek는 DeepSeek 회사에서 만든 인공지능 모델 패밀리를 지칭합니다. 이러한 모델들은 코드 생성, …
RefinedWeb은 파운데이션 모델 사전 훈련을 위해 설계된 필터링된 웹 페이지의 대규모 데이터셋입니다. 이 데이터셋은 저품질 콘텐츠, 중복 항목 및 유해 자 …
지도 미세 조정(SFT) …
토큰 제한은 대규모 언어 모델의 컨텍스트 윈도우 크기 제약을 정의하며, 한 번에 분석하거나 생성할 수 있는 텍스트의 양을 제한합니다. 이 아키텍처적 경계는 메모 …
프롬프트 인젝션은 대용량 언어 모델(LLM)이 사용자 지시를 해석하는 방식을 악용하여, 입력 텍스트 내에 숨겨지거나 상충되는 지시를 삽입합니다. 이로 인해 모델 …
이 방법은 프롬프트 내에 직접적인 설명 예시를 몇 개 제공함으로써 대규모 언어 모델의 문맥 내 학습(In-context learning) 능력을 활용합니다. 모 …
함수 호출은 대규모 언어 모델이 외부 도구 및 API와 상호작용할 수 있도록 합니다. 모델은 실행할 함수 이름과 필요한 인자(arguments) …
제로 샷 학습은 초기 학습 단계에서 레이블이 지정된 훈련 데이터가 제공되지 않은 새로운 범주나 작업에 대해 모델이 일반화될 수 있도록 합니다. 이는 일반적으로 …
사후 훈련은 대규모 일반 데이터로 초기 사전 훈련이 완료된 후 발생하는 머신러닝 라이프사이클의 중요한 단계입니다. 이 단계에서 모델은 특정 태스크에 맞게 미세 …
이 과정은 일반적인 사전 훈련과 특정 작업 수행 사이의 격차를 메웁니다. 다양한 지시문-응답 쌍에 노출시킴으로써, 모델은 추가적인 조정 없이 미처 보지 못한 작 …
생각의 사슬(Chain-of-Thought, CoT) 프롬프팅은 대규모 언어 모델이 최종 답안에 도달하기 전에 단계별 추론 설명을 생성하도록 안내하는 전략입니 …
프롬프트 엔지니어링은 생성형 AI 모델로부터 정확하고 관련성이 높으며 고품질의 응답을 이끌어내기 위해 ‘프롬프트’라고 불리는 특정 입력을 …