AI превод
STELAR Tech Brief № 3: Разширяване на данните с отчитане на пристрастията за идентифициране на рискове, свързани с храните
Намаляване на пристрастността в моделите за обработка на естествен език (NLP) за откриване на рискове в агрохранителната промишленост чрез структурирано разширяване на данните и надеждна предварителна обработка
или
Подробно описание
Предвзетостта в машинното обучение в областта на безопасността на селскостопанските и хранителните продукти — като например дисбаланс между класовете, езикови различия и несъответствия в дължината на текстовете — влошава точността на моделите. В настоящата статия се представя структуриран работен процес за смекчаване на тези проблеми чрез оценка на данните, почистване (премахване на дубликати, обработка на липсващи стойности чрез смесване на характеристики) и целенасочено обогатяване. Рамка от 10 метода (например замяна на синоними, трансфер на стил, обобщаване на текст) генерира 16 синтетични точки данни в пет класа, което значително подобрява балансираната точност. Фино настроените модели BART и ChatGPT 4.0 генерират последователни синтетични данни с ниска загуба. Техники като допълване, кодиране и подбор на характеристики повишават устойчивостта. Подходът намалява изчислителните разходи, като същевременно поддържа контекстуална точност, предлагайки мащабируемо и отговорно решение с изкуствен интелект за идентифициране на рискове, свързани с храните. Част от финансирания от ЕС проект STELAR (идентификационен номер на гранта: 101070122), ръководен от Вивек Кумар от Университета на Бундесвера в Мюнхен.
1/1
или
Подробна информация за приноса
- Проект
- Местоположение
- Germany, Europe
- Автори
- Vivek Kumar
- Цел
- Communication, Dissemination
- Тип файл
- документ
- Създаден на
- 18.02.2025 г.
- Език на оригинала
- English
- Официален уебсайт на проекта
- STELAR
- Лиценз
- Other
- Ключови думи