AI превод

STELAR Tech Brief № 3: Разширяване на данните с отчитане на пристрастията за идентифициране на рискове, свързани с храните

Намаляване на пристрастността в моделите за обработка на естествен език (NLP) за откриване на рискове в агрохранителната промишленост чрез структурирано разширяване на данните и надеждна предварителна обработка

или

Подробно описание

Предвзетостта в машинното обучение в областта на безопасността на селскостопанските и хранителните продукти — като например дисбаланс между класовете, езикови различия и несъответствия в дължината на текстовете — влошава точността на моделите. В настоящата статия се представя структуриран работен процес за смекчаване на тези проблеми чрез оценка на данните, почистване (премахване на дубликати, обработка на липсващи стойности чрез смесване на характеристики) и целенасочено обогатяване. Рамка от 10 метода (например замяна на синоними, трансфер на стил, обобщаване на текст) генерира 16 синтетични точки данни в пет класа, което значително подобрява балансираната точност. Фино настроените модели BART и ChatGPT 4.0 генерират последователни синтетични данни с ниска загуба. Техники като допълване, кодиране и подбор на характеристики повишават устойчивостта. Подходът намалява изчислителните разходи, като същевременно поддържа контекстуална точност, предлагайки мащабируемо и отговорно решение с изкуствен интелект за идентифициране на рискове, свързани с храните. Част от финансирания от ЕС проект STELAR (идентификационен номер на гранта: 101070122), ръководен от Вивек Кумар от Университета на Бундесвера в Мюнхен.

1/1

или

Подробна информация за приноса

Проект

STELAR

Spatio-TEmporal Linked data tools for the AgRi-food data space

Местоположение
Germany, Europe
Автори
Vivek Kumar
Цел
Communication, Dissemination

Тип файл
документ
Създаден на
18.02.2025 г.
Език на оригинала
English
Официален уебсайт на проекта
STELAR
Лиценз
Other