Decomposing Wrong-Consensus Agreement in LLM Self-Consistency: A GPT-4.1 Case Study
A quantitative account of the failure of majority voting over multiple LLM samples to raise answer accuracy, yet its gain varies erratically: on hard questions it can even backfire.
Lizhuo Zhang, Mengmeng Tang, Chenfeng Long et al.
· 0 citations