🔬 Un equipo adaptó 21 024 frases en bahasa indonesio y validó sus etiquetas con lingüistas para crear IDeal, un corpus de etiquetado gramatical. En una prueba con 2 457 oraciones de una sola cláusula, los modelos mejoraron cerca de un 8 % en casos generales y un 9 % ante palabras ambiguas.
El etiquetado de categorías gramaticales influye en otras tareas de análisis de texto. Los autores señalan dos obstáculos: palabras con más de un significado y términos que no aparecen en los datos de entrenamiento. También atribuyen parte del problema a la falta de corpus consistentes y verificables.
Para desarrollar IDeal siguieron seis pasos: seleccionaron lingüistas, buscaron inconsistencias, prepararon los datos, detectaron y corrigieron etiquetas, y evaluaron el corpus. La variación entre etiquetas bajó: la entropía pasó de 0,04 a 0,02. Según la evaluación, IDeal superó referencias previas.
✅ Un corpus con etiquetas más consistentes puede mejorar el análisis automático de textos en bahasa indonesio, sobre todo cuando una palabra admite varias clases. El resultado se limita a 2 457 oraciones de una sola cláusula; falta comprobar si el rendimiento se mantiene en textos con estructuras más complejas.



