O primeiro benchmark local tinha quatro perguntas e uma ambiguidade escondida: a classe de produto aparecia dentro do texto, mas não existia como dado auditável. Isso era pouco para uma retomada que precisava explicar suas decisões.
Do qrel ao caminho real
O conjunto dev passou a congelar 60 casos: 24 factuais, 12 visuais, 12 sem evidência e 12 adversariais ou cross-project. Cada consulta carrega intent e class. A rota HTTP também os recebe; a classe filtra no servidor e a telemetria devolve o que foi consultado.
Uma falha concreta
Na primeira rodada, uma referência visual apontava para 9.3.jpeg, arquivo que não existia. O inventário do Studio mostrou o ângulo real 9.1.jpeg. Corrigimos a fixture, não o limiar.
Resultado e limite
Depois da correção: 60/60 conjuntos exact, 60/60 com proveniência válida e 24 abstenções. É benchmark lexical local, sem corpus externo e com acceptance=false. Não é ainda revisão humana, embeddings, três rodadas estatísticas ou G5.