Lo que he construido
La IA permitió dejar de leer los resúmenes de otros y coger las fuentes primarias para construir un sistema que responde a partir de ellas.
206
patentes de GoogleMecánica de subasta, pujas y CPM, detección de tráfico inválido, antifraude. Recopiladas automáticamente de registros públicos.
302
pruebas del caso antimonopolioPresentaciones internas, correspondencia de directivos, declaraciones juradas. El tribunal ordenó a ambas partes publicarlas, y salió a la luz lo que normalmente nunca sale de la empresa.
55
escritos judiciales y transcripcionesIncluida la sentencia sobre el fondo del 17 de abril de 2025 y la declaración del responsable de los sistemas publicitarios de Google.
Por qué no se le puede confiar esto a una sola IA
Con este volumen cualquier modelo empieza a inventar: produce porcentajes verosímiles que no están en ningún documento. Lo comprobé — lo hacen todos. Por eso cada pregunta pasa por cuatro rondas con cuatro modelos distintos.
Descomposición de la preguntaLa pregunta se divide en partes independientes para poder buscar cada una por separado. gpt-oss-120b
Recogida de evidenciasCada parte se busca en la base de documentos en su propia pasada, todas a la vez. deepseek-v4-flash
SíntesisLos hallazgos se reúnen en un único análisis con referencias a los documentos. qwen3-235b
VerificaciónEl análisis se contrasta con las fuentes y se tacha todo lo que no aparece en ellas. yandexgpt-32k
El modelo verificador es a propósito de una familia distinta que el que redacta: fallan de forma diferente, y lo que uno inventa el otro no lo confirma contra los extractos. Detecta con regularidad porcentajes inventados y nombres inexistentes, que es la mejor prueba de que el sistema funciona como debe.
Cada respuesta viene con una captura de la página
No un enlace a algún sitio, sino la hoja concreta de la patente o la diapositiva exacta de donde sale la cita. El sistema encuentra la página correcta comparando el texto del extracto con el texto de todas las páginas del documento.
Los temas estrechos viven en bases aparte
La base principal responde preguntas sobre subastas, pujas y tráfico inválido. Pero hay temas vecinos que no se pueden echar dentro: el sistema saca veinte extractos por pregunta, y ese es un techo duro. Mete ahí las patentes de CAPTCHA y empezarán a robar espacio a las de IVT justo en las preguntas donde IVT es lo que necesitas.
Así que cada tema de estos tiene su propia base y su propio agente, y el código decide a cuál preguntar según cómo esté formulada la pregunta:
Verificación humanaCAPTCHA, retos, puntuación de riesgo, distinguir un bot de una personaAnalítica webeventos y sesiones, conversiones, atribución, enlace entre dispositivosAd serverAd Manager, Open Bidding, prioridad de line items, pujas del lado del servidorCalidad del contenidoclasificación de páginas, palabras clave, elegibilidad del publisher
Pregunta por CAPTCHA y el agente especialista se suma con su propia base, y su material queda marcado aparte en la respuesta combinada. Pregunta por subastas y se mantiene completamente al margen.
Una historia aparte: el vídeo de las pruebas del caso
Cómo una grabación que estaba en la base como peso muerto se convirtió en uno de los documentos más citados.
Entre las pruebas del caso hay un vídeo de catorce minutos. El almacenamiento lo aceptó como vídeo y no extrajo nada: ni audio, ni texto, ni imágenes. Revisé los 878 extractos que el sistema había citado en sus respuestas: esta grabación no apareció ni una sola vez.
Dentro había dos capas, y ambas valiosas. En pantalla, diapositivas de Google sobre el paso a la subasta de primer precio, con la frase explícita «no last look for programmatic». Debajo, una transcripción incrustada en el fotograma como subtítulos, numerada por página y línea. Habla gente real: el product manager de Exchange Bidding explica los cambios y los representantes de los publishers replican.
«Todo ese control — y control es aquí la palabra clave — nos lo van a quitar, y solo nos queda confiar en que Google actúe en nuestro mejor interés. Eso es mucho tragar» — desde el lado de los publishers, líneas 40:4–40:7.
Qué hice con él
No hizo falta reconocimiento de voz: el texto ya estaba en pantalla y llevaba los números de página de la transcripción, que el audio no tiene en absoluto. Localicé los límites exactos de la banda de subtítulos, la recorté de los fotogramas cada segundo y medio y la pasé por reconocimiento de texto.
288
líneas de transcripciónDe la página 11 a la 96. Las líneas se fusionan por su número «página:línea», así que no hay duplicados: una misma línea permanece en pantalla durante varios fotogramas.
3
diapositivas de la presentaciónEncontradas comparando huellas de fotogramas y conservadas enteras, junto con lo que se dijo mientras cada una estaba en pantalla.
17
páginas del documento finalUna diapositiva y lo que se dijo sobre ella, y después la transcripción completa. Un PDF corriente con texto real: la búsqueda y las capturas de página funcionan sobre él.
Dos comprobaciones dieron fruto. Las transcripciones de deposición llevan veinticinco líneas por página, así que las líneas numeradas 33 y 34 eran errores de reconocimiento y las descarté. Y volví a muestrear los huecos de la numeración cada medio segundo: no se añadió ni una línea, lo que significa que son cortes de edición reales. Solo se aportaron extractos como prueba, no la grabación entera; ahora eso está verificado y no supuesto.
El resultado
Una grabación que nunca había participado en una respuesta se cita ahora junto a las patentes. Pregunta por los floor prices por comprador y el sistema responde citándola — y te enseña la página.