🔬 Un equipo de Princeton puso a prueba un sistema de IA diseñado para investigar dos problemas de machine learning. Ejecutó cientos de experimentos y revisó bibliografía, pero los autores de los trabajos de referencia le dieron 2/6 y 1/6: no resolvió bien las tareas abiertas. El resultado sugiere que aún no puede sustituir a sus creadores en investigación abierta.
El análisis, publicado como preprint en arXiv, evaluó una versión modificada de OpenClaw que usaba Claude Opus 4.8. El sistema contaba con herramientas para acceder a Internet, ejecutar experimentos, crear subagentes y simular revisión por pares. Para cada problema tuvo seis días y créditos de cómputo por US$3 000.
Los investigadores usaron una «evaluación sombra»: pidieron al sistema que escribiera trabajos a partir de dos preguntas de papers enviados a NeurIPS y encargaron la revisión a los autores originales. La IA manejó bien la parte de ingeniería, detectó algunas afirmaciones falsas propias y no buscó atajos. Sin embargo, solía elegir pocas hipótesis, aferrarse pronto a una y revisar sus decisiones con poca dureza.
✅ El ensayo apunta a que estos sistemas pueden apoyar tareas de investigación, pero todavía tropiezan al explorar problemas abiertos. El límite es claro: solo evaluó dos preguntas, con un presupuesto y un plazo definidos. Además, es un preprint pendiente de revisión por pares.



