Investigación

Trabajo ejecutado, con corpus medido y conclusión escrita. No hay ideas ni hipótesis sin datos: si no se midió, no está aquí.

Corpus medido el

InvestigaciónInforme de banco de pruebas

Cuatro modelos, el mismo defecto real, un juez que ninguno vio

Pregunta: ¿Una suite verde escrita por quien implementa demuestra que el defecto está corregido?

Su propia suiteSonda independienteLínea base 5/7
Las dos columnas miden lo mismo —fracción de comprobaciones superadas— así que comparten escala. A la izquierda, lo que cada modelo se puntúa con las pruebas que él mismo escribió. A la derecha, lo que mide una sonda que ningún modelo vio, con la línea base marcada. La distancia entre las dos columnas es el resultado.
Ver la tabla
ModeloSu propia suiteSonda independiente
Línea base5/7
Gemini 3.6 Flash (High)187/1876/7
Gemini 3.1 Pro (Low)187/1875/7
Claude Opus 4.6 (Thinking)190/1905/7
Claude Sonnet 4.6 (Thinking)191/1915/7

Hallazgos

  • Cuatro modelos recibieron el mismo defecto real, el mismo prompt y la misma base, cada uno en su espacio de trabajo aislado. Los cuatro entregaron typecheck estricto limpio, entre 187 y 191 pruebas en verde, cero patrones prohibidos y cero ficheros fuera de alcance. Por cualquier criterio automático, trabajo impecable.
  • Una sonda escrita por el Director, que ningún modelo vio, evaluó el resultado contra la reproducción del defecto. La línea base pasaba 5 de 7 casos. Tres de los cuatro modelos siguieron pasando 5 de 7: el defecto quedó exactamente igual. Uno llegó a 6.
  • Cada modelo añadió pruebas propias que pasan. Esas pruebas codifican su propio entendimiento del defecto, y cuando ese entendimiento es incorrecto, la prueba verde certifica el malentendido en lugar de detectarlo.
  • El caso más instructivo diagnosticó el defecto con precisión en un comentario del código, escribió la corrección, añadió pruebas, y el defecto siguió pasando. Entender un fallo y resolverlo son dos capacidades distintas, y este experimento las separa por primera vez.
  • El único que mejoró fue de una familia distinta a los otros dos, que fallaron igual. Con un solo proveedor no habría habido ninguna mejora.
  • El tiempo no predijo la calidad: el más lento y el más rápido sacaron la misma nota, y el ganador quedó en medio.

Lo que esto NO dice

  • n = 1 por modelo. Una tarea, una ejecución. No es una medida de capacidad general.
  • Una sola clase de defecto, que puede favorecer a unos modelos sobre otros.
  • No mide coste ni tokens: la herramienta no los expone en modo no interactivo. Es una limitación medida, no una omisión.
  • Un modelo quedó excluido con evidencia: su cuota estaba agotada y la herramienta lo sustituía en silencio por otro. Incluirlo habría medido dos veces el mismo motor.
InvestigaciónSerie NEXTGEN

Qué separa de verdad a un modelo de otro, medido en llamadas reales

Pregunta: ¿Sobre qué dimensión se puede construir un selector de modelos que no sea ruido?

Hallazgos

  • El ranking de calidad entre los modelos libres quedó refutado como reproducible. Con una sola repetición, la permutación exacta da p = 0,96; ninguno de los 21 pares resultó significativo.
  • La dimensión que sí separa es la latencia mediana: p = 5×10⁻⁵ y un factor 3,03 entre extremos, informativa en las 14 tareas y con coste marginal cero.
  • El respeto al esquema de salida discrimina, y lo predice la familia del modelo, no su tamaño: unos lo honran, otros lo ignoran y otros lo rechazan con error.
  • La pieza más rentable del sistema resultó ser el validador de forma: detecta el 37,5 % de los fallos con cero falsos positivos, cero llamadas y cero tokens.
  • El motor de consenso por mayoría quedó refutado como decisor —peor resultado a siete veces el coste— y confirmado como detector: cero fallos silenciosos.
  • La batería de calidad está saturada: casi todas las tareas las resuelven todos los modelos. Costó 195 llamadas descubrirlo, y ese es el resultado.

Lo que esto NO dice

  • La curva de potencia del diseño satura: ninguna cantidad de repeticiones de este experimento baja del 7,5 % de probabilidad de que el último de la tabla sea el primero.
  • El coste monetario medido fue cero en las 730 llamadas, lo que hace que este ciclo no diga nada sobre la economía de un proveedor de pago.
InvestigaciónMisión RF-001

Censo del ecosistema de agentes

Pregunta: ¿Qué existe ya ahí fuera, y qué de lo que DARXI construye está resuelto por otros?

Hallazgos

  • En curso. Hay corpus de evidencia por plataforma, recogido por una flota de agentes con un cuestionario idéntico para todas.

Lo que esto NO dice

  • Ninguno de los documentos de síntesis está cerrado. Se publica el método y el estado, no conclusiones que todavía no existen.

El corpus de estos experimentos no está publicado, así que cada documento se cita por su nombre y no se enlaza. Los límites van al lado de los hallazgos, con el mismo peso: un resultado presentado sin lo que no midió se lee como una ley, y ninguno de estos lo es.