TT-0002 · Duración de las peticiones y procesamiento del historial
Suceso principal: S39.
Estado y fechas vigentes: índice CSV.
Seguimiento: W-S39.
Pregunta examinada
Determinar si la demora corresponde a bloqueo, agotamiento del presupuesto, procesamiento del historial o interferencia de otra carga.
Condiciones y observaciones
La petición léxica identificada en el JSON de evidencia se admitió con 1 899 unidades de entrada, reserva de 2 048, razonamiento activado, semilla 299792458 y límite de 600 segundos. Sucedió a nueve turnos de la misma conversación. La pantalla aportada mostraba procesamiento de antecedentes a los 386 segundos.
La lectura directa del archivo JSONL conservado localizó la admisión 461 y la finalización 499, con el mismo identificador de petición. Terminó con fin_normal, retorno 0, 220 unidades generadas y duración 514,897928769 s. La primera salida se registró a los 435,677830103 s. Por tanto, esta petición no terminó por el límite de 600 segundos. La terminación normal no evalúa la respuesta.
En los nueve turnos anteriores, la entrada creció de 126 a 1 772 unidades; la primera salida pasó de 19,864965382 a 403,117891225 segundos. Esta secuencia describe los casos observados y no constituye una comparación controlada: cambian las preguntas, los antecedentes y las salidas.
Examen de la implementación
Cada petición inicia un proceso de inferencia, carga los pesos y vuelve a procesar el contexto completo. La preparación se divide en fragmentos de 64 unidades. No se reutiliza entre peticiones una caché de atención del historial ya procesado. El coste de esta preparación es una hipótesis respaldada por la estructura del programa, pero no está aislado mediante duraciones independientes de carga, preparación y generación.
La compilación pendiente se aplazó al observar una inferencia activa. Durante la petición examinada no se inició esa compilación; la posterior compilación de la actualización se hizo después del cierre. Las lecturas breves de procesos no acreditan ausencia de toda interferencia del entorno. La intención de provocar competencia entre cargas no basta para declarar realizado un ensayo de concurrencia.
Condición de cierre y siguiente prueba
Antes de modificar el tratamiento del historial, registrar duración de carga, preparación y generación, ocupación de CPU, memoria y actividad concurrente, con ámbito y reloj definidos. Comparar una consulta breve en una conversación vacía y la misma consulta con un historial identificado, manteniendo pesos y parámetros. Cada ejecución debe tener presupuesto previo. Una prueba de competencia exige además acreditar el solapamiento temporal de los procesos. No se ejecuta esa campaña por la mera apertura del tique.
El cierre requiere una causa suficientemente delimitada y una mejora comprobada con conservación íntegra de antecedentes, o una limitación de uso aceptada y explícita.
Evidencia común y procedencia
- Identidad, condiciones y comprobaciones de esta revisión.
- Revisión de las nueve peticiones anteriores.
- Código examinado y adaptador del modelo.
La ficha distingue datos observados, interpretación y trabajo pendiente. El cierre del tique no cierra automáticamente S39.
Preparación de la medición por fases · 22 de septiembre de 2026
Tras la autorización del titular se ha preparado el candidato 0.1.2. El adaptador distingue lectura del tokenizador, carga del modelo, procesamiento inicial del contexto y generación. Registra además el tiempo hasta el primer token en el proceso de inferencia. Estas duraciones no incluyen la espera anterior a la ejecución, la preparación del contexto en el servidor ni el transporte al navegador. La medida previa de primera salida textual conserva su ámbito distinto. Una interrupción no convierte una fase incompleta en una duración total acreditada.
La campaña preparada comprende doce generaciones: tres preguntas sintéticas, con y sin antecedentes, y con ambos modos de generación. Cada caso reserva 384 unidades de salida y 180 segundos; se conserva la semilla 299792458. El presupuesto nominal de generación asciende como máximo a 36 minutos, más preparación y cierre. La comparación conserva la identidad de los pesos y no altera los expedientes existentes. El cambio de modo incorpora también los parámetros de muestreo recomendados para ese modo; no permite atribuir toda diferencia exclusivamente al razonamiento.
La compilación, las pruebas en Rust y la campaña no se han ejecutado. Tampoco se han medido todavía CPU o concurrencia de manera continua. El tique permanece abierto: disponer del código de medición no acredita la causa de la demora ni una mejora de rendimiento.
Revisión detallada del candidato · Evidencia de esta preparación.
Medición ejecutada · 22 de septiembre de 2026
La campaña de la revisión 0.1.2 se ha completado con doce generaciones: nueve terminaciones normales y tres interrupciones por tiempo. Se utilizó Qwen3-0.6B Q4_K_M en CPU, con la identidad de los pesos, tokenizador y Candle conservada. Cada condición se ejecutó una vez, con reserva de 384 tokens de salida y límite de 180 segundos. Las condiciones con razonamiento y antecedentes alcanzaron las tres el límite temporal.
El procesamiento inicial del contexto consumió entre 15,79 y 28,92 segundos sin antecedentes —123–140 tokens— y entre 132,17 y 152,47 segundos con antecedentes —829–846 tokens—. La carga del modelo se situó entre 1,21 y 2,42 segundos. Estas medidas del proceso hijo permiten identificar una contribución dominante del procesamiento del contexto a la espera previa; no incluyen red ni preparación anterior en el servidor. Las fases interrumpidas permanecen sin duración final atribuida.
Los antecedentes son 24 registros sintéticos y neutros; no reproducen la conversación sanitaria del titular. No hubo otra inferencia ni compilación de esta intervención durante la campaña, pero no se monitorizó continuamente toda la actividad de CPU. El cambio de modo modifica también temperatura y Top-P. No se deriva una atribución causal exclusiva ni una estimación estadística de fiabilidad.
El tique permanece en ejecución. Se ha acreditado la medición, no una mejora de velocidad. La ventana configurada de 16.384 tokens no constituye una longitud práctica de conversación validada. Quedan por establecer el rendimiento admisible y las mejoras que puedan justificarse mediante comparación controlada.
Informe de verificación y comparación · Evidencia de esta revisión.
Actualización de alcance · 23 de septiembre de 2026
Finalizado en esta campaña con limitación de latencia aceptada. Mediciones conservadas; sin mejora de velocidad acreditada.
Cierre de Qwen/B y evidencia · TT-0011. La conclusión de esta campaña conserva los resultados anteriores y sus carencias; no equivale a una corrección completa ni prescribe nuevas gestiones administrativas.