← ProjectsACTIVE · CASE STUDY
AI Evaluation Lab
Kumpulan benchmark mandiri untuk menguji instruction following, factuality, rubric design, dan kualitas feedback.
01 · Problem
Masalah yang diselesaikan
Klaim “bisa mengevaluasi AI” sulit diverifikasi tanpa contoh kerja.
02 · Solution
Keputusan & implementasi
Publikasikan benchmark independen dengan prompt, dua respons, rubric, verdict, dan revised answer.
03 · Outcome
Hasil / pembelajaran
Recruiter dapat menilai cara berpikir dari artefak nyata tanpa material rahasia pihak ketiga.