신뢰할 수 있는 AI
Definition
신뢰할 수 있는 AI는 AI 시스템이 신뢰성 있고 윤리적으로 작동하도록 보장하는 원칙과 관행을 포괄합니다. 주요 속성에는 공격에 대한 강건성, 다양한 인구 집단 …
Terms tagged with Safety
신뢰할 수 있는 AI는 AI 시스템이 신뢰성 있고 윤리적으로 작동하도록 보장하는 원칙과 관행을 포괄합니다. 주요 속성에는 공격에 대한 강건성, 다양한 인구 집단 …
AI에서의 독성은 경멸적이거나 토론에서 참여자를 이탈하게 만들 가능성이 높거나 특정 정체성에 초점을 맞춘 콘텐츠를 생성하거나 확산하는 것을 의미합니다. 이는 미 …
독성 감지는 자연어 처리 기술을 활용하여 텍스트 입력을 분석하고, 해로운 콘텐츠일 확률을 나타내는 확률 점수를 할당합니다. 이러한 시스템은 일반적으로 감독 학 …
AI 안전성과 윤리에서 강건성은 예기치 않은 입력이나 악의적 조작에 대한 모델의 회복력을 의미합니다. 강건한 시스템은 입력 데이터에 노이즈가 포함되어 있더라도 …
AI에서의 신뢰성은 시간과 다양한 입력에 걸쳐 시스템 행동의 신뢰성과 일관성을 의미합니다. 신뢰할 수 있는 AI 시스템은 정확한 결과를 생성하고, 예외 상 …
허위 정보는 해를 끼치거나 기만하려는 고의적인 의도 없이 공유되는 거짓 또는 오해의 소지가 있는 정보를 지칭합니다. 이는 의도적으로 조작된 정보인 ‘ …
기계적 해석 가능성은 개별 뉴런, 가중치, 회로 수준에서 특정 기능이 어떻게 계산되는지 이해하기 위해 신경망을 역공학하는 데 중점을 둡니다. …
인간 감독은 인간이 AI 기반 결정이나 행동을 모니터링, 평가 및 개입하는 메커니즘과 프로세스를 의미합니다. 이 개념은 자동화 시스템이 작동할 …
유해 콘텐츠란 신체적, 심리적 또는 사회적 손상을 일으킬 수 있는 디지털 미디어나 텍스트를 의미합니다. AI …
가드레일(Guardrails)은 AI 애플리케이션, 특히 대형 언어 모델에 통합된 소프트웨어 제어 및 정책 집행 레이어의 집합을 의미합니다. 이는 모델이 안전하 …
기만적 정렬은 고수준의 AI 시스템이 학습 중에 정렬된 행동을 보이는 것이 배포될 가능성을 높인다는 것을 학습하고, 비밀리에 정렬되지 않은 목표를 유지하는 상황 …
이 적대적 기법은 훈련 데이터를 변경하여 머신러닝 모델의 무결성을 훼손하는 것을 목표로 합니다. 공격자는 미묘한 오류나 편향된 예제를 도입하여 모델이 잘못된 패 …
콘텐츠 필터링은 알고리즘과 규칙을 사용하여 사용자에게 제시되는 정보의 흐름을 스캔, 분류 및 제어하는 것을 포함합니다. AI 컨텍스트에서는 종종 자연어 처 …
헌법적 AI는 모든 단계에서 인간 피드백에만 의존하지 않고 대규모 언어 모델을 인간의 가치와 정렬시키기 위한 프레임워크입니다. …
이 과정에는 안전 한계나 윤리 가이드라인과 같은 사전 정의된 제약 사항을 준수하도록 에이전트의 행동을 보장하기 위해 수학적 방법을 사용하는 것이 포함됩니다. 이 …
AI 정렬은 인공지능 시스템이 사용자가 문자 그대로 지시한 것보다 사용자가 의도한 바를 강력하게 수행하도록 만드는 과제를 다룹니다. 이는 AI 시스템이 인간의 …
휴먼 인 더 루프(HITL)는 데이터 라벨링, 모델 평가, 최종 의사결정 승인 등 워크플로우의 다양한 단계에서 인간의 개입이 필요한 AI 시스템을 의미합니다. …
인공지능에서 공정성은 인종, 성별, 연령과 같은 보호된 속성에 기반한 사회적 편향을 재생성하거나 증폭시키지 않도록 알고리즘이 보장해야 하는 중요한 윤리적 지표입 …
이 개념은 SHAP이나 LIME과 같은 기법을 통해 모델이 특정 예측에 도달하는 방식을 시각화함으로써 복잡한 AI 시스템의 ‘블랙박스’ 문 …
AI 윤리는 인공지능 기술이 책임감 있게 개발되고 사용되도록 보장하기 위해 설계된 원칙과 표준의 체계를 포괄합니다. 여기서는 알고리즘 편향, 투명성, 책임 소 …
AI 보안은 적대적 공격, 데이터 독성 및 모델 추출과 같은 위협으로부터 머신러닝 모델, 데이터 파이프라인 및 배포 인프라를 보호하기 위한 조치를 포괄합니다. …
AI 윤리에서 편향(Bias)은 알고리즘적 의사결정에서 체계적이고 불공정한 차별을 지칭하며, 이는 종종 치우친 학습 데이터나 결함이 있는 모델 설계로 인해 발생 …