Saltar al contenido
●  Monday, 28 de September de 2026
Vol. VII · Edición Nº 184
Madrid · Ciudad de México
Periodismo científico
desde 2019
Inicio / technology / Artículo

technology

Tecnología: Un corpus afinado para bahasa indonesio

Un equipo adaptó 21 024 frases en bahasa indonesio y validó sus etiquetas con lingüistas para crear IDeal, un corpus de etiquetado gramatical. En una prueba…

1 min de lectura
August 12, 2026

🔬 Un equipo adaptó 21 024 frases en bahasa indonesio y validó sus etiquetas con lingüistas para crear IDeal, un corpus de etiquetado gramatical. En una prueba con 2 457 oraciones de una sola cláusula, los modelos mejoraron cerca de un 8 % en casos generales y un 9 % ante palabras ambiguas.

El etiquetado de categorías gramaticales influye en otras tareas de análisis de texto. Los autores señalan dos obstáculos: palabras con más de un significado y términos que no aparecen en los datos de entrenamiento. También atribuyen parte del problema a la falta de corpus consistentes y verificables.

Para desarrollar IDeal siguieron seis pasos: seleccionaron lingüistas, buscaron inconsistencias, prepararon los datos, detectaron y corrigieron etiquetas, y evaluaron el corpus. La variación entre etiquetas bajó: la entropía pasó de 0,04 a 0,02. Según la evaluación, IDeal superó referencias previas.

✅ Un corpus con etiquetas más consistentes puede mejorar el análisis automático de textos en bahasa indonesio, sobre todo cuando una palabra admite varias clases. El resultado se limita a 2 457 oraciones de una sola cláusula; falta comprobar si el rendimiento se mantiene en textos con estructuras más complejas.


Deja un comentario

Your email address will not be published. Required fields are marked *