Льстивость (Сиффантизм)
Definition
Льстивость — это режим отказа в больших языковых моделях, при котором система ставит во …
Terms tagged with Evaluation
Льстивость — это режим отказа в больших языковых моделях, при котором система ставит во …
В машинном обучении стабильность относится к устойчивости производительности и параметров …
MAUVE — это статистическая мера, предназначенная для оценки того, насколько близко вывод …
Кросс-валидация методом «один против всех» (LOOCV) является частным случаем k-блочной …
Утечка данных — это критическая ошибка в машинном обучении, при которой модель получает …
LLM-as-a-Judge — это парадигма оценки, при которой большая языковая модель выступает в …
Индекс Inception (IS) — это статистическая мера, введенная для оценки производительности …
FrontierMath — это специализированный набор для тестирования, созданный для проверки …
Эта область включает анализ таких метрик, как точность (accuracy), прецизионность …
Кросс-валидация — это статистический метод, используемый для оценки эффективности моделей …
Матрица ошибок — это специфическая табличная структура, позволяющая визуализировать …
Этот термин относится к систематической оценке и бенчмаркингу различных библиотек и …
Этот метрика количественно оценивает, насколько хорошо набор категорий позволяет …
Также известная как функция стоимости или ошибка, функция потерь предоставляет скалярное …
Обнаружение выбросов вне распределения (OOD) идентифицирует входные данные, выходящие за …
В искусственном интеллекте термин «высокое качество» обычно описывает данные или выходные …
Набор данных «held-out» (отложенный) состоит из примеров, намеренно исключенных из фазы …
Тестовый набор — это часть данных, исключенная из процесса обучения для оценки …
Оценки количественно определяют, насколько хорошо модель машинного обучения работает …
При оценке моделей ИИ показатели «общего» характера обеспечивают целостное представление …
В искусственном интеллекте доказательство относится к эмпирическим данным, статистическим …
В искусственном интеллекте бенчмарк — это стандартизированный набор тестов или датасет, …
Бенчмарк служит стандартизированной точкой отсчета для сравнения возможностей различных …
В контексте ИИ анализ относится к систематическому изучению данных, предсказаний модели …
Галлюцинации возникают, когда генеративные ИИ-модели выдают результат, который кажется …