Why it matters
Where this breaks real systems
If an LLM judge selects releases, scores agents or filters generated content, answer order can become an invisible evaluation variable.
Evidence status: strong for LLM-as-a-judge settings; varies across judges, tasks and quality gaps
Evidence level: peer reviewed large scale multi model

