Traducido por IA

Ficha técnica de STELAR n.º 3: Aumento de datos con consideración del sesgo para la identificación de riesgos alimentarios

Reducción del sesgo en los modelos de PLN para la detección de riesgos agroalimentarios mediante el aumento estructurado de datos y un preprocesamiento robusto

o

Descripción detallada

Los sesgos en el aprendizaje automático aplicado a la seguridad agroalimentaria —como el desequilibrio de clases, la variación lingüística y la inconsistencia en la longitud de los textos— merman la precisión de los modelos. Este artículo presenta un proceso estructurado para mitigar estos problemas mediante la evaluación de los datos, su limpieza (eliminación de duplicados y tratamiento de valores perdidos mediante la combinación de características) y el aumento de datos específico. Un marco compuesto por diez métodos (por ejemplo, sustitución de sinónimos, transferencia de estilo y resumen de textos) genera 16 puntos de datos sintéticos repartidos en cinco clases, lo que mejora significativamente la precisión equilibrada. Los modelos BART ajustados y ChatGPT 4.0 producen datos sintéticos consistentes y con baja pérdida. Técnicas como el relleno, la codificación y la selección de características mejoran la robustez. El enfoque reduce los costes computacionales al tiempo que mantiene la precisión contextual, ofreciendo una solución de IA escalable y responsable para la identificación de riesgos alimentarios. Forma parte del proyecto STELAR, financiado por la UE (n.º de subvención: 101070122), dirigido por Vivek Kumar en la Universidad de la Bundeswehr de Múnich.

1/1

o

Información detallada sobre la contribución

Proyecto

STELAR

Spatio-TEmporal Linked data tools for the AgRi-food data space

Ubicación
Germany, Europe
Autores
Vivek Kumar
Propósito
Communication, Dissemination

Tipo de fichero
documento
Creado el
18 feb 2025
Lengua materna
English
Web oficial del proyecto
STELAR
Licencia
Other