← ProjectsACTIVE · CASE STUDY

AI Evaluation Lab

Kumpulan benchmark mandiri untuk menguji instruction following, factuality, rubric design, dan kualitas feedback.

Rubric DesignQAReasoningWriting
01 · Problem

Masalah yang diselesaikan

Klaim “bisa mengevaluasi AI” sulit diverifikasi tanpa contoh kerja.
02 · Solution

Keputusan & implementasi

Publikasikan benchmark independen dengan prompt, dua respons, rubric, verdict, dan revised answer.
03 · Outcome

Hasil / pembelajaran

Recruiter dapat menilai cara berpikir dari artefak nyata tanpa material rahasia pihak ketiga.