Sisifisme
Definition
Sisifisme adalah kegagalan mode dalam model bahasa besar di mana sistem mengutamakan …
Terms tagged with Evaluation
Sisifisme adalah kegagalan mode dalam model bahasa besar di mana sistem mengutamakan …
Dalam pembelajaran mesin, stabilitas mengacu pada ketahanan kinerja dan parameter model …
MAUVE adalah ukuran statistik yang dirancang untuk menilai seberapa dekat output model …
Validasi silang leave-one-out (LOOCV) adalah kasus khusus dari validasi silang k-fold di …
Kebocoran data adalah kesalahan kritis dalam pembelajaran mesin di mana model memperoleh …
LLM-as-a-Judge adalah paradigma evaluasi di mana sebuah Model Bahasa Besar (LLM) …
Skor Inception (IS) adalah ukuran statistik yang diperkenalkan untuk menilai kinerja …
FrontierMath adalah suite evaluasi khusus yang dibuat untuk menguji batas kemampuan model …
Bidang ini melibatkan analisis metrik seperti akurasi, presisi, recall, skor F1, dan Area …
Validasi silang adalah metode statistik yang digunakan untuk memperkirakan kinerja model …
Matriks kebingungan adalah tata letak tabel spesifik yang memungkinkan visualisasi …
Istilah ini merujuk pada penilaian sistematis dan pembandingan berbagai perpustakaan dan …
Metrik ini mengukur seberapa baik satu set kategori memungkinkan seseorang untuk …
Dikenal juga sebagai fungsi biaya atau kesalahan, fungsi kerugian menyediakan nilai …
Deteksi out-of-distribution (OOD) mengidentifikasi input yang berada di luar cakupan …
Dalam kecerdasan buatan, berkualitas tinggi biasanya menggambarkan data atau output model …
Dataset ‘held-out’ terdiri dari contoh-contoh yang sengaja dikecualikan dari …
Himpunan uji (test set) adalah bagian data yang disisihkan selama proses pelatihan untuk …
Skor mengukur seberapa baik model pembelajaran mesin berkinerja terhadap metrik tertentu …
Saat mengevaluasi model AI, metrik ‘keseluruhan’ memberikan pandangan …
Dalam kecerdasan buatan, bukti merujuk pada data empiris, hasil statistik, atau hasil …
Dalam kecerdasan buatan, benchmark adalah serangkaian tes atau dataset terstandarisasi …
Sebuah benchmark berfungsi sebagai titik referensi standar untuk membandingkan kemampuan …
Dalam konteks AI, analisis merujuk pada pemeriksaan sistematis terhadap data, prediksi …
Halusinasi terjadi ketika model AI generatif menghasilkan output yang tampak masuk akal …