Las empresas ya licencian su código fuente privado como datos de evaluación de IA

Specific Labs pagó a una empresa de producto de consumo y a una plataforma fintech por el acceso a sus repositorios y creó un activo de evaluación que nadie puede rastrear

|5 min de lectura0
Production source code of the kind Specific Labs now licenses from operating businesses to evaluate AI coding agents
Production source code of the kind Specific Labs now licenses from operating businesses to evaluate AI coding agents

Una empresa de producto de consumo con más de 200.000 usuarios y una plataforma fintech que ha procesado más de 100.000 extractos bancarios hicieron algo inusual con sus repositorios privados: licenciarlos a una empresa de evaluación. Specific Labs, respaldada por Y Combinator, reunió esas bases de código en Real-SWE y, al hacerlo, convirtió el código propietario en una mercancía por la que la industria de la IA ha empezado a pagar.

Claves

  • Specific Labs licenció repositorios de producción de empresas en operación en lugar de rastrear proyectos de código abierto, y así obtuvo material de evaluación que ningún modelo pudo leer durante el preentrenamiento.
  • La compañía calcula que el 99% de los tokens que viven dentro de las empresas reales resulta invisible para los modelos de frontera, y ese vacío de oferta es la razón de ser del mercado de licencias.
  • Los verificadores se inyectan solo en el momento de la calificación y salen de las suites de pruebas que ya existen en cada base de código, de modo que la licencia debe cubrir también las pruebas.

La lógica económica es sencilla una vez enunciada. El material de evaluación público tiene fecha de caducidad, porque todo lo que se publica termina en algún corpus de entrenamiento y deja de separar la memoria del razonamiento. El código privado no sufre ese desgaste, pero tiene dueño, y conseguirlo exige negociar en lugar de rastrear.

Qué debe incluir una base de código licenciada

El acceso al código no basta para construir una evaluación. Specific Labs ejecuta cada agente en un entorno aislado, guarda las tareas en formato Harbor e inyecta al calificar verificadores inspirados en las pruebas que ya viven en el repositorio, cuando no tomados literalmente de ellas. Una licencia útil abarca por tanto el repositorio, su suite de pruebas y el historial de incidencias que vuelve realista cada tarea.

Las tareas resultantes no se parecen en nada a un rompecabezas de laboratorio. Una encamina cada factura por el régimen fiscal propio del negocio, incluida la fijación de precios según destino a través de un proveedor de la autoridad tributaria. Otra traslada la propiedad de las ofertas y del consumo desde los servicios hacia los clientes sin romper las lecturas existentes. Una tercera descubre todas las regiones de AWS habilitadas y recorre el inventario de almacenamiento en bloque sin que el fallo de una región derribe el resto.

Cada empresa tiene sus propias reglas y su manera de escribir código. Los agentes deben entender esas convenciones y hacer cambios que funcionen con lo que ya existe.

El alcance se deduce de ahí. Las soluciones de Real-SWE tocan una mediana de 11 archivos, casi el doble de los seis de suites públicas como FrontierCode y DeepSWE. Los cambios que alteran el funcionamiento de un negocio rara vez se quedan dentro de un solo servicio.

Lo que revelaron los datos licenciados

Los primeros resultados dan a quienes licencian algo que mostrar. Claude Fable 5.1 ejecutado dentro de Claude Code encabezó la tabla con un 38,8%, seguido de GPT-6 Astra sobre Codex CLI con un 33,8% y de Gemini 3.8 Flash sobre Gemini CLI con un 31,2%. La tasa de resolución es pass@1 promediada sobre ocho ejecuciones independientes por tarea y se publica con intervalos de confianza del 95%.

Para quien evalúe un acuerdo similar, el matiz decisivo es que las puntuaciones están atadas a un arnés y no solo a un modelo. Real-SWE empareja cada sistema con su herramienta nativa porque así trabajan los ingenieros de empresa, lo que significa que el repositorio licenciado mide un flujo de trabajo completo: modelo, andamiaje y convenciones del IDE juntos. Los mismos pesos con otro andamiaje podrían aterrizar en un lugar muy distinto.

Por qué este mercado tenderá a crecer

Quien compra un asistente de programación con IA apenas tiene forma de saber si el número de una tabla clasificatoria sobrevive al contacto con sus propios sistemas, y los proveedores tienen pocos incentivos para construir la prueba que se lo diría. Un tercero independiente que paga por código privado se sitúa justo en medio, y cuanto más se saturan los benchmarks públicos, más vale esa posición. Anthropic, OpenAI y Google tienen modelos en esta tabla, y ninguno controla los datos que hay detrás.

Las salvedades son reales. Diez tareas son una muestra pequeña y el ejercicio no demuestra por sí solo que la contaminación infle los benchmarks públicos. Licenciar también concentra el poder de evaluar en quien pueda costear los acuerdos, y un benchmark cuyo contenido nadie puede inspeccionar desde fuera exige una confianza distinta de la que pide un conjunto de datos abierto: la misma tensión asoma en otros benchmarks de agentes recientes que publicaron metodología sin resultados.

Preguntas frecuentes

¿Por qué licenciaría una empresa su código fuente privado?

El código privado vale para los evaluadores precisamente porque nunca se publicó, así que no pudo filtrarse a los datos de entrenamiento. Esa escasez es lo que paga una empresa de evaluación, y quien licencia cobra sin abrir nada al público.

¿Real-SWE publica el código que licenció?

No. Ni el código ni sus soluciones de referencia están disponibles públicamente, y esa es la premisa entera del benchmark. Specific Labs publica descripciones de tareas y puntuaciones, no los repositorios.

¿Qué modelo obtuvo la puntuación más alta en Real-SWE?

Claude Fable 5.1 a través de Claude Code lideró con un 38,8%, por delante de GPT-6 Astra sobre Codex CLI con un 33,8% y de Gemini 3.8 Flash sobre Gemini CLI con un 31,2%. Todos los sistemas probados fallaron en la mayoría de las tareas.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Agentes de IA inundaron RubyGems con 2.000 paquetes y el registro cerró las altas cuatro días
Developer Tools

Agentes de IA inundaron RubyGems con 2.000 paquetes y el registro cerró las altas cuatro días

Un informe forense reconstruye la campaña GemStuffer de mayo, en la que agentes de IA subieron más de 2.000 gems y forzaron a RubyGems a congelar las nuevas altas cuatro días.

Seung Junghace 6 días
Shopify compra Tailwind Labs mientras la IA erosiona el negocio del framework
Developer Tools

Shopify compra Tailwind Labs mientras la IA erosiona el negocio del framework

Shopify adquirió Tailwind Labs, creadora de Tailwind CSS. El framework mantiene su licencia MIT mientras Tailwind Plus y ui.sh dejan de aceptar nuevas suscripciones.

Seung Junghace 6 días
Los reparadores con LLM rompieron código que funcionaba diez veces más a menudo de lo que arreglaron el defectuoso
Developer Tools

Los reparadores con LLM rompieron código que funcionaba diez veces más a menudo de lo que arreglaron el defectuoso

Un estudio en arXiv midió un bucle de reparación con LLM dañando programas correctos a 0,261 y arreglando los defectuosos a 0,023, y halló la dirección interna que lo impulsa.

Seung Junghace 5 días
HydraFusion de GitHub deja de elegir un modelo: monta un flujo de trabajo
Developer Tools

HydraFusion de GitHub deja de elegir un modelo: monta un flujo de trabajo

Project HydraFusion, de GitHub, arma un plan multimodelo para cada petición de Copilot y cambia la sencillez de un único modelo por un coste mucho más bajo.

Seung Junghace 5 días
OpenAI abre a los desarrolladores su modelo de voz full-duplex por cinco centavos el minuto
Developer Tools

OpenAI abre a los desarrolladores su modelo de voz full-duplex por cinco centavos el minuto

El modelo de voz full-duplex GPT-Live-1 de OpenAI ya está en la API por 0,05 dólares el minuto, con un 86,2 % en Tau3 frente al 45,7 % de su antecesor.

Seung Junghace 7 días
SWE-2 de Cognition queda a un punto de la frontera por un 64% menos
Developer Tools

SWE-2 de Cognition queda a un punto de la frontera por un 64% menos

Cognition afirma que SWE-2 obtiene 50,0% en FrontierCode 1.1 Main, un punto por detrás de Fable 5.1, con un coste 64% menor y sobre una base china abierta.

Seung Junghace 7 días