KI-Ausrichtung
term_id: ai_alignment
Category: ethics_safety
Definition
Die KI-Ausrichtung befasst sich mit der Herausforderung, künstliche Intelligenz-Systeme so robust zu gestalten, dass sie das tun, was ihre Benutzer intendieren, anstatt nur das, was sie wörtlich spezifizieren. Dies umfasst technische Methoden, um sicherzustellen, dass…
Summary
Das Forschungsgebiet, das sich damit befasst, sicherzustellen, dass KI-Systeme im Einklang mit menschlichen Werten und Absichten handeln.
Key Concepts
- Wertelernen
- Nützliches Verhalten
- Kontrollproblem
- Interpretierbarkeit
Use Cases
- Forschung zur Sicherheit bei großen Sprachmodellen
- Entwicklung von Belohnungsfunktionen für RLHF
- Implementierung ethischer Richtlinien