BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories
Researchers introduce BabelJudge, an open-source framework that audits LLM-as-a-judge systems for systematic biases including position bias, verbosity bias, and cross-lingual degradation. The benchmark reveals significant reliability gaps across languages, with performance dropping from 0.714 in Hindi to 0.550 in Swahili, and extends evaluation to agentic AI systems through trajectory-level perturbations.