InvestigaciónInforme de banco de pruebas
Cuatro modelos, el mismo defecto real, un juez que ninguno vio
Pregunta: ¿Una suite verde escrita por quien implementa demuestra que el defecto está corregido?
Su propia suiteSonda independienteLínea base 5/7
Gemini 3.6 Flash (High)
187/187
6/7
Gemini 3.1 Pro (Low)
187/187
5/7
Claude Opus 4.6 (Thinking)
190/190
5/7
Claude Sonnet 4.6 (Thinking)
191/191
5/7
Ver la tabla
| Modelo | Su propia suite | Sonda independiente |
|---|---|---|
| Línea base | — | 5/7 |
| Gemini 3.6 Flash (High) | 187/187 | 6/7 |
| Gemini 3.1 Pro (Low) | 187/187 | 5/7 |
| Claude Opus 4.6 (Thinking) | 190/190 | 5/7 |
| Claude Sonnet 4.6 (Thinking) | 191/191 | 5/7 |
Hallazgos
- Cuatro modelos recibieron el mismo defecto real, el mismo prompt y la misma base, cada uno en su espacio de trabajo aislado. Los cuatro entregaron typecheck estricto limpio, entre 187 y 191 pruebas en verde, cero patrones prohibidos y cero ficheros fuera de alcance. Por cualquier criterio automático, trabajo impecable.
- Una sonda escrita por el Director, que ningún modelo vio, evaluó el resultado contra la reproducción del defecto. La línea base pasaba 5 de 7 casos. Tres de los cuatro modelos siguieron pasando 5 de 7: el defecto quedó exactamente igual. Uno llegó a 6.
- Cada modelo añadió pruebas propias que pasan. Esas pruebas codifican su propio entendimiento del defecto, y cuando ese entendimiento es incorrecto, la prueba verde certifica el malentendido en lugar de detectarlo.
- El caso más instructivo diagnosticó el defecto con precisión en un comentario del código, escribió la corrección, añadió pruebas, y el defecto siguió pasando. Entender un fallo y resolverlo son dos capacidades distintas, y este experimento las separa por primera vez.
- El único que mejoró fue de una familia distinta a los otros dos, que fallaron igual. Con un solo proveedor no habría habido ninguna mejora.
- El tiempo no predijo la calidad: el más lento y el más rápido sacaron la misma nota, y el ganador quedó en medio.
Lo que esto NO dice
- n = 1 por modelo. Una tarea, una ejecución. No es una medida de capacidad general.
- Una sola clase de defecto, que puede favorecer a unos modelos sobre otros.
- No mide coste ni tokens: la herramienta no los expone en modo no interactivo. Es una limitación medida, no una omisión.
- Un modelo quedó excluido con evidencia: su cuota estaba agotada y la herramienta lo sustituía en silencio por otro. Incluirlo habría medido dos veces el mismo motor.