🔬 Un equipo de Hainan University y Tianjin University desarrolló MembraneBERT, un modelo de lenguaje para extraer datos de artículos sobre separación de gases con membranas. Al aplicarlo a 3 580 artículos adicionales, obtuvo 2 283 registros estructurados sobre membranas y su rendimiento, un paso útil para investigar con datos.
La separación con membranas es una tecnología relevante para procesos de energía y ambiente. El equipo creó una tubería de procesamiento de lenguaje que incluye un transformador adaptado al campo para analizar literatura científica.
El principal reto fue el desequilibrio de datos, que puede sesgar el modelo hacia las clases más frecuentes. Los autores combinaron aumento de datos que evita filtraciones y un ajuste fino con una función de pérdida que une entropía cruzada ponderada por clase y pérdida focal.
MembraneBERT alcanzó una precisión media de 0,906, una recuperación de 0,796 y una puntuación F1 de 0,844. Los registros extraídos reúnen datos sobre membranas y su desempeño al separar gases.
✅ El modelo podría facilitar la creación de conjuntos de datos para investigaciones posteriores sobre separación de gases con membranas. El límite es que el texto aportado no detalla cómo se validaron de forma individual los 2 283 registros extraídos ni su desempeño fuera de esos artículos.



