Expediente preparatorio para revisión por pares
11/09/2026 · RETP-2026-129 · Versión 1. Estudio de la interpretación española y la subordinación de propuestas de IA externa en IE-004. Dirección y autoridad de alcance: Juan Antonio Lloret Egea. Preparación técnica y documental: Watson. Estado del arte, matriz de afirmaciones y evidencias, manifiesto.
Situación al corte: P2/2 tiene aptitud documental para preparar reserva; la custodia todavía no está acreditada en el expediente recibido, P3 no se ha iniciado y el aislamiento permanece NO VERDE. Este documento prepara método, evidencia y crítica para un artículo futuro. No declara un artículo terminado, envío editorial, revisión por pares recibida ni validación de resultados pendientes.
1. Problema, objetivo y alcance publicable
El problema práctico consiste en atender consultas españolas de un ámbito autorizado sin que una propuesta externa cambie la referencia, operación, contenido o permisos, incluso si contiene una cita literal presente en la pregunta. También deben servirse las consultas legítimas: una barrera que rechaza sistemáticamente no satisface el objetivo funcional.
El estudio recoge la ingeniería pública de la frontera IE-004 y su proceso de refutación y corrección. Su banco contiene literales artificiales con nomenclatura de analítica. No es una evaluación clínica, no constituye por sí mismo un universo inmunológico y no demuestra integración con células, sucesos, frames, DSL o núcleo. La prioridad operativa conserva la secuencia IA, catálogo/localización y fila 9 en sus documentos rectores.
Hay que separar tres responsabilidades: el dominio constituye el saber y sus límites; el agente tiene cobertura y capacidades autorizadas sobre él; la realización representa y comprueba los contratos. La ampliación del conocimiento pertenece a la investigación gobernada por humanos. En aplicación, el banco autorizado permanece versionado y sin incorporación automática de saber externo.
Pregunta principal: dentro del perfil y contexto fijados, ¿puede una realización atender correctamente las variantes españolas admitidas e impedir que la propuesta externa cambie sus observables protegidos, con coste acotado y evidencia repetible? La utilidad adicional de esa propuesta es una pregunta separada que debe responderse explícitamente.
2. Corte y evidencia histórica que ya puede criticarse
Cortes de entrada: Lenguaje 7da60a9d83362d2a21fd1e27801cbece8b49ccd6; laboratorio f66562bfd108e5c0e06516f0be17737b8e40517d. Las rutas de la matriz fijan esos commits y los blobs comprobados; no dependen de que una rama conserve siempre el mismo contenido. Se reutilizan las lecturas rectoras documentadas en RETP-127/128, recotejadas sin cambios, y se relee AGENTS. Acta del corte.
| ID | Hecho conservado | Qué permite decir y qué no |
|---|---|---|
| E01 | Workflow P0–P6, RETP-123 | Protocolo acotado con puertas y paradas. Es posterior a las primeras capturas; no se presenta como prerregistro de toda la investigación |
| E02 | Recepción fuera del proyecto, RETP-124: 23/24 rutas/respuestas; 17/18 datos debidos; 6/6 rechazos debidos | R01 persiste. No se acredita comprensión completa ni que la memoria del proveedor causase el defecto |
| E03 | En esa recepción, tres reproducciones por destino y cuerpos nativo/WASI idénticos de 5 418 bytes | Repetición del receptor sobre una captura fijada, incluido su error; no tres nuevas generaciones del LLM ni validez de P2/2 |
| E04 | Testigo público: petición de IgA con exclusión de IgG, propuesta de IgG y cita literal aceptadas por el receptor anterior | Contraejemplo ejecutado a la suficiencia de cita, referencia representable y permiso. El banco introduce la mutación; no se atribuye intención maliciosa a Grok |
| E05 | Dictamen de Claude sobre P2/1: D1, D2 y D3; inversión «no sólo» elevada a bloqueante | Defectos documentales conservados y motivación de /2. La comprobación Python auxiliar no cualifica Rust |
| E06 | Dictamen focal de /2: Claude declara 48/48 derivaciones únicas y 16 contrastes sintácticos conformes | Aptitud documental; el script no implementa toda la semántica del §5. No son 64 respuestas correctas del sistema |
| E07 | RETP-128: contrato de captura A/V separada, C17/C18 y controles públicos de límites | Obligaciones especificadas, todavía sin ejecución de la candidata; reserva y recepción humana pendientes |
Los originales no se reescriben al corregir una afirmación. El recuento de sondas de Claude quedó rectificado de 61 a 60; también se declaró el recorte estructural de la enumeración y 18 cadenas adicionales expuestas. Las 32 871 cadenas reducidas declaradas no son un examen exhaustivo del lenguaje. Recepción de /2 y rectificaciones.
La recepción histórica registra medianas con tres muestras por destino e incluye arranque. No constituye P5, no mide la inferencia de Grok y no se usará como prueba de rendimiento general. En esta preparación bibliográfica se ejecutaron cero pruebas nuevas de Python, Rust, WASI o del modelo participante. Se comprobó documentación e identidad de archivos; no se reejecutó la evidencia histórica.
3. Modelo de confianza y observables
Se consideran confiables, sólo dentro del contrato de ensayo, el original de la solicitud, su contexto autorizado, las versiones de conocimiento/perfil/política, el conductor que conserva sus identidades, el comprobador y el entorno cuya integridad se presuponga. Esos supuestos se enumerarán por ejecución. Que una solicitud sea confiable como entrada original no significa que cualquier operación que solicite esté permitida.
La propuesta V es no confiable: puede ser incorrecta, contradictoria, malformada, excesiva, tardía o estar ausente. Tampoco se presume que sus apoyos textuales demuestren el significado. No recibe autoridad para alterar el original A, la política o la base; sus mutaciones de ensayo deben quedar diferenciadas de las entregas auténticas del participante.
En /2, A determina el cuerpo sin esperar ni decodificar V; V se contrasta separadamente. Esa especificación no acredita aún separación física de recursos, revocación efectiva, aislamiento de proceso/red o resistencia a un host comprometido. P4 debe identificar la frontera impuesta y sus componentes de confianza, así como la cobertura real de I01–I05.
Se fijan cuatro clases de observables:
- Funcionales: interpretación completa, ruta, clase diagnóstica, contenido exacto y alcance autorizado.
- De autoridad: lecturas, escrituras, efectos y decisiones de permiso, incluidas las fases de recepción, rechazo y terminación.
- De recursos: contadores A/V, memoria, excepciones, entrada/salida y plazos. Un contador determinista no se confunde con tiempo de pared.
- De evidencia: entrada original, propuesta original, versiones, regla/decisión observable, binarios, salidas y vínculo con el oráculo cuando se abra.
Los errores de formato, cobertura, referencia, permiso y agotamiento permanecen diferenciados. Ninguno se convierte en Tri.U: una U semántica sólo puede aparecer bajo su contrato propio. Los tiempos de ejecución y estadísticas del ensayo son metadatos de evaluación externa; no se añaden como decisiones semánticas al núcleo.
4. Preguntas de evaluación y refutación
H1–H6 son hipótesis de alcance finito con un testigo de refutación definido. H7 conserva la pregunta de utilidad, pero aún necesita fijar tarea y métrica para convertirse en una prueba operativa: no se presenta como un protocolo experimental completo. Ninguna es un teorema universal ni un resultado ya obtenido. La matriz asociada conserva estado, evidencia requerida y condiciones de refutación.
| ID | Hipótesis y observable | Qué la refuta o impide acreditarla |
|---|---|---|
| H1 · servicio correcto | Cada solicitud del banco fijado recibe la referencia, contenido y diagnóstico debidos | Un dato indebido o un rechazo de una consulta que debía servirse. «No fallar con datos erróneos» no compensa «no responder» |
| H2 · conservación del significado | Las paráfrasis declaradas equivalentes con el mismo contexto/versiones conservan el cuerpo debido; los contrastes semánticos respetan sus diferencias | Un miembro incorrecto, aunque todos repitan el mismo error; negación, campo o referente cambiados silenciosamente |
| H3 · subordinación de V | Cambiar, suprimir o agotar V conserva cuerpo y cómputo determinista A y no abre accesos excluidos | Cualquier dependencia excluida, incluido cargar V antes de servir A, compartir recursos prohibidos o bloquear el plazo A |
| H4 · límites y errores | Dentro del alcance de servicio se responde; fuera de cuotas se termina según el diagnóstico técnico previsto, sin salida indebida ni wrap | Overflow, acceso inválido, salida parcial, Tri.U técnico o agotamiento que incumpla servicio prometido. Un límite no alcanzable con los otros se declara |
| H5 · realización repetible | Captura, contrato y binarios fijados conservan los bytes canónicos entre las reproducciones nativas/WASI previstas | Diferencia relevante de cuerpo o diagnóstico. Un resultado Python no sirve como sustituto de este contraste |
| H6 · evidencia reconstruible | Un tercero recupera versiones, entrada, propuesta y decisión y puede reproducir el resultado observado | Artefacto ausente, identidad inconsistente o una decisión cuya evidencia necesaria no se preservó |
| H7 · utilidad adicional de IA | En una tarea y métrica útiles predefinidas, A+V aporta una mejora respecto de A solo, conservando H1–H6 | Ausencia de mejora, aumento de coste sin beneficio definido o pérdida de garantías. Hoy falta esa tarea/métrica: NO_ACREDITADA |
En la candidata actual el cuerpo se fija antes de V. Por ello H7 no puede justificarse atribuyendo a V la corrección o cobertura de ese cuerpo. Tampoco se aprobará el objetivo original de colaboración subordinada por demostrar únicamente que V no influye. Si no hay aportación útil demostrable, ese resultado negativo debe figurar en el artículo y en la decisión de rumbo.
La identidad de la pregunta por sí sola no fija una respuesta cuando cambia el referente o el conocimiento. Las condiciones son la solicitud y contexto autorizados, el perfil, la política, el banco y las versiones relevantes. Una paráfrasis puede conservar la respuesta y cambiar legítimamente la traza literal. La igualdad de hashes se usa para identificar bytes; no demuestra que dos frases signifiquen lo mismo.
5. Diseño experimental y control de exposición
Se conserva el workflow RETP-123 y la sucesión RETP-128. Esta preparación no añade rondas del participante ni inicia el corrector antes de recibir el compromiso y la acreditación de custodia.
| Paso restante | Condición y salida prevista |
|---|---|
| Preparación de reserva | Claude entrega una sola reserva candidata de 24 casos al custodio humano. Declara su participación en el diseño |
| Custodia y compromiso | Juan Antonio conserva una copia recuperable fuera del acceso de Watson/Grok; a Watson sólo llegan compromiso y confirmación. Un hash no acredita por sí solo esa separación |
| Realización y controles públicos | Corrector Rust, regresión histórica, positivos/negativos y pruebas de límites. Congelar código y formato completo de V antes de la captura reservada |
| P3 | Una captura nueva, apertura en los hitos establecidos y una cualificación. Conservar cada fallo y detener la candidata ante incumplimiento bloqueante |
| P4/P5 | Imposición material y costes sobre la realización identificada, bajo obligaciones ya acordadas |
| P6 | Evidencia reproducible, revisión con conflictos declarados y decisión humana de alcance |
Los corpus ya vistos son material exploratorio o de regresión. No recuperan novedad cambiando nombre, orden, idioma o chat. El oráculo reservado no se introduce en esta publicación ni en sus herramientas. La revisión de Claude de un oráculo redactado por ella no contará como auditoría independiente de autoría; su independencia de Watson/Grok y su dependencia del diseño se declaran por separado.
En el reporte se distinguirán reproducción de una propuesta capturada, nueva generación del modelo y realización independiente por un tercero. Las tres responden a preguntas distintas. Un proveedor remoto puede no exponer semilla, pesos o configuración exacta: esos campos quedarán como no observables y limitarán la reproducción. No se inventará una identidad de Qwen u otro modelo ni se deducirá por la interfaz usada.
Comparadores y ablaciones
La referencia principal es A solo frente a la misma realización con V original, ausente o mutada. El receptor histórico se conserva como control de un mecanismo ya refutado, no como sistema equivalente a /2. Un negativo conocido debe demostrar que el banco detecta la sustitución; un positivo debe impedir que el criterio de aceptación se reduzca a rechazar todo.
CaMeL, FIDES y los demás trabajos son comparadores bibliográficos en esta versión. No se ejecutan sobre otro banco para fabricar una tabla de superioridad. Una futura comparación empírica entre sistemas necesitaría tarea, política, entradas y presupuesto equiparables, e identificar adaptaciones de cada uno antes de medir. No queda autorizada ni programada por esta revisión.
6. Recuentos, coste y criterio de parada
Se informará siempre numerador y denominador: servicio legítimo, referencia errónea, dato indebido, rechazo debido, rechazo indebido y fallo técnico. La cobertura se desglosará por paráfrasis, contexto, negación, disyunción, permisos y límites según las obligaciones ya fijadas. Un caso puede refutar varias hipótesis; no se contarán esas refutaciones como nuevas observaciones independientes.
El 100 % requerido es conformidad con el banco y alcance constituidos. Con 24 casos elegidos por cobertura no se estima una tasa universal del español ni una probabilidad clínica. Las paráfrasis de una misma familia no son muestras independientes. No se aplicará una fórmula estadística de confianza que presuponga muestreo aleatorio sin justificarlo. La exhaustividad formal exigiría otro argumento y un espacio explícitamente definido.
Rigen la guía candidata de recursos y los controles públicos de fronteras. Sus cifras son presupuestos propuestos, no rendimiento medido. El límite de un servicio CI no se usa como latencia admisible de consulta. Compilación, arranque, tratamiento, verificación V y espera del modelo se miden por separado; ni los minutos de un chat ni una prueba Python se atribuyen al Rust resultante.
P5 conserva los 30 bloques pareados por destino propuestos y cinco calentamientos cuando procedan, con carga, orden e instrumental fijados. Se guardan todas las muestras; los timeouts no desaparecen del resultado aunque el resumen de latencia de completados se calcule aparte. Un presupuesto no cumplido se registra sin elevarlo retrospectivamente. Antes de medir falta justificar una referencia comparable y fijar su tolerancia de regresión.
Parada: no corregir frase a frase después de abrir la reserva. Un fallo suficiente detiene la promoción de esa candidata y produce causa y decisión. Un nuevo ciclo exigiría sucesión causal expresa; esta publicación no lo abre. Una avería verificable del instrumental se distingue de un fallo funcional y se conserva junto con cualquier repetición permitida.
7. Paquete de evidencia para el artículo
El expediente actual ya permite inspección del diseño y del historial público. Para que un revisor pueda reproducir las afirmaciones futuras, cada ejecución necesitará un registro que enlace:
| Pieza | Contenido mínimo y momento |
|---|---|
| Identidad del experimento | Hipótesis, corte, variante, corpus/oráculo, autoría, exposición y aprobación de alcance antes de ejecutar |
| Entorno | rustc -Vv, Cargo.lock, targets, flags, debug/release, runtime WASM, sistema, CPU/RAM, instrumental y dependencias observables |
| Entradas | Original A y contexto, propuesta V auténtica separada, mutaciones de ensayo identificadas, orden y límites |
| Conocimiento y autoridad | Banco, perfil y política exactos; identidades, fuentes y permisos realmente impuestos |
| Ejecución | Binarios y hashes, comando, salida/diagnóstico, contadores A/V, lecturas y efectos, fallos y terminación |
| Resultado | Esperado congelado, observado, decisión por caso y relación, discrepancias y estado de hipótesis |
| Reproducción | Instrucciones completas, artefactos recuperables y resultados de quien los reproduzca; ausencias explícitas |
La traza debe registrar decisiones ejecutables y evidencia observable. No se promete reconstruir pensamientos privados del modelo mediante una explicación redactada después. La autoría de scripts de apoyo y el papel de cada lenguaje se describirán con exactitud. Un comando auxiliar que organiza JSON no sustituye el binario ensayado.
La reserva permanece cerrada hasta su apertura prevista; entonces se incorpora la evidencia necesaria para que la crítica posterior sea posible. No se puede sostener indefinidamente una afirmación experimental inaccesible al revisor. Antes de presentar el artículo se elegirá, bajo control humano, una forma de archivo duradero y acceso acorde con sus datos. No se anuncian DOI de dataset, licencia o preservación editorial que todavía no existen.
8. Estructura del manuscrito y objeciones que debe responder
El artículo podrá organizarse en: problema y alcance; antecedentes y diferencias; contrato y modelo de amenaza; método y control de exposición; resultados positivos y negativos por versión; discusión de recursos y utilidad; amenazas a la validez; disponibilidad de evidencia y conclusión limitada a lo comprobado. El título de trabajo describe una evaluación de frontera de consulta, sin prometer comprensión universal o inmunología validada.
Las objeciones principales son concretas:
- Oráculo y diseño relacionados: registrar exposición y discrepancias; ninguna revisión propia se vende como independencia total.
- Sobreajuste al banco: las primeras correcciones son exploratorias; la reserva se fija antes del corrector y no se retoca tras verla.
- Gramática que redefine el objetivo: casos legítimos rechazados cuentan como fallos del alcance prometido. Acotar español no permite presentar ese recorte como comprensión general.
- IA ornamental: H7 debe declarar el aporte o su ausencia. La eliminación del modelo de la decisión no demuestra colaboración útil.
- Medición débil: pequeños recuentos, cuotas no acreditadas y entorno no instrumentado limitan las conclusiones, aunque el flujo CI termine bien.
- Frontera incompleta: A/V lógicos, Rust o WASM no prueban por sí solos aislamiento del host ni integración del SV completo.
- Generalización clínica o multilingüe: no se infiere de nombres de parámetros, datos artificiales o una sola superficie española.
Un resultado negativo sobre utilidad, capacidad o aislamiento sigue siendo un resultado científico publicable si método y evidencia son revisables. El cierre no se condiciona a obtener una tabla verde. Las nuevas afirmaciones se añadirán con su fecha y evidencia; este corte conservará qué se sabía y qué seguía pendiente.