
Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.





