Фирменный знак Agrorisk DNAAGRORISK.RUИздательский дом

Статья журнала

Методы фазификации для анализа данных в цифровых платформах сельского хозяйства

Fuzzification Methods for Data Analysis in Digital Agricultural Platforms

Цитирование

Стукалин А.В. Методы фазификации для анализа данных в цифровых платформах сельского хозяйства // Управление рисками в АПК. – 2022. – № 3 (45). – С. 60–66. – DOI: 10.53988/24136573-2022-03-07.

Citation

Stukalin A.V. Fuzzification Methods for Data Analysis in Digital Agricultural Platforms // Agricultural Risk Management. 2022. No. 3 (45). Pp. 60–66. DOI: 10.53988/24136573- 2022-03-07.

Аннотация

В статье исследованы методы фазификации данных применительно к архитектуре цифровых платформ АПК. Рассмотрены требования к обработке лингвистических и неопределенных данных, ограничения классических функций принадлежности и направление дискретного битового представления для массового сравнения и агрегирования объектов.

Ключевые слова

фазификация, нечёткие множества, битовое представление, цифровая платформа, сельское хозяйство, обработка данных, ранжирование. Alexey V. Stukalin Fuzzification Methods for Data Analysis in Digital Agricultural Platforms Alexey V. Stukalin – Russian State Agrarian University – Moscow Timiryazev Agricultural Academy, Moscow, Russia, e-mail: astukalin@mail.ru. Annotation The article examines fuzzification methods for digital agricultural platforms. Requirements for processing linguistic and uncertain data, limitations of conventional membership functions and a direction based on discrete bit representation for large- scale comparison and aggregation are discussed.

Keywords

fuzzification, fuzzy sets, bit representation, digital platform, agriculture, data processing, ranking. Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 66 Введение Исследование цифровых платформ как объекта анализа и проектирования в агропромышленном комплексе. Платформенные решения рассматриваются как один из ключевых инструментов перехода от разрозненных прикладных разработок к масштабируемым, повторно используемым и интегрируемым цифровым продуктам. В условиях цифровой трансформации АПК платформенный подход обеспечивает консолидацию данных, унификацию сервисов и построение сквозных контуров управления [5, 6]. В инженерно-технической трактовке цифровая платформа может быть представлена как программно-аппаратная среда и совокупность сервисов, обеспечивающих разработку, внедрение и эксплуатацию прикладных решений. Для задач системного анализа продуктивен функционально-архитектурный подход, включающий слой данных и интеграции, слой сервисов обработки и аналитики, прикладные модули и механизмы управления доступом, масштабирования и мониторинга. Для АПК характерны распределенность объектов и источников данных, неоднородность форматов и частоты поступления информации, необходимость учета экспертных и лингвистических оценок, а также высокая контекстная зависимость показателей. Эти особенности приводят к тому, что эффективность платформенных решений определяется качеством алгоритмов представления, обработки и агрегирования данных в условиях неопределенности [7]. Анализ существующих подходов показывает противоречие между архитектурными требованиями платформ – масштабируемостью, производительностью и модульностью – и вычислительными особенностями классических нечетких моделей. Для прикладной эффективности требуется метод, сохраняющий интерпретируемость нечетких оценок и допускающий высокопроизводительную обработку. Это определяет актуальность разработки дискретного, в том числе битового, представления фазифицированных данных. Платформенные решения в АПК переходят от роли хранилища и витрины данных к роли среды, в которой выполняются массовые операции сравнения, ранжирования и агрегирования объектов. Для таких операций важны компактность представления, скорость вычисления и сохранение семантической интерпретируемости. Фазификация позволяет преобразовывать числовые и экспертные оценки в степени принадлежности лингвистическим термам. Классические треугольные, трапецеидальные и гауссовы функции принадлежности хорошо интерпретируются, но при больших массивах требуют хранения и обработки вещественных значений. Одним из направлений развития является дискретное, в том числе битовое, представление фазифицированной информации. При таком подходе принадлежность кодируется маской дискретных состояний, а сравнение и агрегирование могут выполняться быстрыми логическими операциями. Научная задача состоит в выборе дискретизации, сохраняющей достаточную точность по отношению к исходной нечеткой модели. Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 67 В сельском хозяйстве подобный подход потенциально применим к ранжированию хозяйств, оценке рисков, цифровым профилям, мониторингу посевов и агрегированию экспертных признаков. Экспериментальная проверка должна сопоставлять точность, время обработки и объем памяти для классического и дискретного представления. Классификация функций принадлежности Треугольная функция принадлежности удобна при небольшом числе термов и четко заданных опорных точках. Трапецеидальная позволяет задавать область полного соответствия, что удобно для нормативных диапазонов. Гауссова функция обеспечивает плавность и устойчивость к малым изменениям, но требует более сложных вычислений. Выбор функции определяется не эстетикой модели, а типом данных и способом дальнейшего агрегирования [3, 4]. Для экспертных шкал важно сохранять смысл границ термов. Если дискретизация слишком груба, объект может скачкообразно переходить из одного класса в другой. При избыточной детализации исчезает преимущество компактного представления. Поэтому размер битовой маски должен выбираться экспериментально. Алгоритмическая схема битовой фазификации Базовая процедура может включать четыре этапа: нормирование исходного значения, определение интервала и термов, формирование битовой маски, выполнение операций сравнения и агрегирования. Для восстановления интерпретируемого результата применяется отображение битовой комбинации обратно в лингвистическую шкалу или центр соответствующей зоны. Сравнение двух объектов может основываться на пересечении масок, расстоянии Хэмминга или числе совпадающих активных позиций. Такие операции хорошо поддерживаются процессорными архитектурами и могут использоваться при массовом ранжировании. Критерии вычислительного эксперимента. Сопоставление непрерывного и битового представлений позволяет связать точность, объём памяти, скорость вычислений и интерпретируемость результата (таблица 1). Таблица 1 – Сравнение классической фазификации и битового представления данных Критерий Классическая фазификация Битовое представление Вещественные степени Память Компактная маска принадлежности Скорость сравнения Арифметические операции Логические/битовые операции Зависит от схемы Интерпретируемость Высокая дискретизации Точность Высокая при корректной функции Определяется числом уровней Удобно для индексации и Интеграция в платформу Требует вычислительного слоя фильтрации Источник: составлено автором. Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 68 Вычислительная эффективность метода должна оцениваться по нескольким взаимосвязанным критериям. Первый критерий — точность аппроксимации исходной функции принадлежности после дискретизации. Второй — объем памяти, необходимый для хранения фазифицированных признаков. Третий — время выполнения типовых операций сравнения, пересечения и агрегирования. Четвертый — устойчивость итогового ранжирования объектов к изменению шага дискретизации. Пятый — интерпретируемость результата для пользователя платформы, то есть возможность восстановить смысл лингвистического терма и объяснить причину присвоенной оценки. В качестве базового эксперимента может использоваться набор нормированных признаков x∈[0, 1], для которых формируются классические треугольные или трапецеидальные функции принадлежности и их дискретные представления с различным числом уровней. Для каждой конфигурации сопоставляются значения принадлежности, порядок ранжирования объектов и вычислительные затраты. Такой дизайн позволяет определить диапазон дискретизации, при котором выигрыш в производительности не приводит к существенной потере информационного содержания. Интеграция метода в архитектуру цифровой платформы В платформенной архитектуре модуль фазификации целесообразно располагать между слоем первичной подготовки данных и сервисами аналитики. На вход поступают нормированные числовые значения, экспертные оценки или интервальные характеристики. После фазификации формируется унифицированное представление, которое может использоваться модулями ранжирования, классификации, оценки рисков и поддержки решений. Такое разделение повышает повторное использование алгоритмов: одна и та же процедура кодирования может применяться к различным предметным объектам при замене словаря термов и параметров функций принадлежности [5, 6]. Для распределенных сельскохозяйственных систем важна возможность выполнять часть операций непосредственно на периферийных устройствах или в региональных узлах обработки данных. Компактное дискретное представление снижает требования к объему передаваемой информации и может использоваться как промежуточный формат при обмене между сервисами. При этом исходные данные и параметры фазификации должны сохраняться для аудита и воспроизводимости результата. Области применения в АПК Наиболее естественными областями применения являются задачи, в которых исходная информация сочетает количественные измерения и экспертные оценки. К ним относятся оценка технического состояния машин, ранжирование хозяйств по уровню цифровой зрелости, оценка фитосанитарных и погодных рисков, сопоставление альтернатив агротехнологий, мониторинг качества данных и формирование интегральных характеристик устойчивости. Во всех перечисленных случаях пользователь обычно оперирует не только точными Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 69 числами, но и термами «низкий», «средний», «высокий», «допустимый», «критический», что делает фазификацию естественным интерфейсом между измерительными данными и управленческой интерпретацией [7]. Важным ограничением является недопустимость подмены содержательной модели простым кодированием. Битовая маска сама по себе не устраняет неопределенность и не определяет семантику термов. Ее преимущества проявляются лишь при корректно заданных функциях принадлежности, обоснованной дискретизации и сохранении связи с исходным признаком. Поэтому предложенное направление следует рассматривать как вычислительный слой нечеткой модели, а не как альтернативу методологии нечетких множеств. Сравнение непрерывного и дискретного представления фазифицированных данных Классическая фазификация сопоставляет числовому значению степень принадлежности одному или нескольким нечетким множествам. В вычислительной системе результат обычно хранится как набор вещественных чисел. Такое представление универсально и удобно для выполнения операций нечеткого вывода, однако при массовой обработке объектов требует хранения нескольких значений и многократного выполнения арифметических операций [1, 2]. Дискретное представление предполагает квантование степени принадлежности или фиксацию попадания значения в заранее определенные интервалы. Для каждого терма формируется битовая маска, где отдельный разряд отражает выполнение условия принадлежности на выбранном уровне. Если используется m термов и k уровней квантования, состояние объекта может быть представлено последовательностью из m×k битов. Такое кодирование не отменяет исходную функцию принадлежности, а создает компактную форму ее вычислительного представления. Пусть μi(x) — степень принадлежности значения x i-му терму, а τj — j-й порог. Бит bij принимает значение 1, если μi(x) ≥ τj, и 0 в противном случае. Совокупность bij образует код B(x). Сравнение объектов может выполняться через побитовые операции, подсчет совпадающих разрядов или расстояние Хэмминга. При этом смысл порогов и термов сохраняется, что поддерживает интерпретируемость результата. Преимущество битовой формы проявляется при фильтрации и предварительном ранжировании большого числа записей. Побитовые операции хорошо поддерживаются процессорами и базами данных, а код может передаваться между модулями платформы как компактный атрибут. Это особенно важно для распределенной архитектуры, где одинаковая логика классификации должна применяться к данным из различных источников. Ограничением является потеря части информации вследствие дискретизации. Чем меньше уровней квантования, тем компактнее код и выше риск объединить различающиеся значения. Увеличение числа порогов повышает точность, но уменьшает выигрыш в объеме и скорости. Поэтому параметры кодирования Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 70 должны определяться исходя из допустимой ошибки, требований задачи и структуры функции принадлежности. Непрерывное и дискретное представления не являются взаимоисключающими. Битовая фазификация может использоваться как первый уровень обработки для быстрого отбора кандидатов, после чего для ограниченного множества объектов выполняется точный нечеткий расчет. Двухступенчатая схема сочетает вычислительную эффективность и точность интерпретации. Требования к вычислительной и содержательной верификации метода Экспериментальная проверка метода должна включать по меньшей мере четыре группы критериев: точность воспроизведения исходной классификации, устойчивость к шуму, вычислительную сложность и интерпретируемость. Точность оценивается сравнением результатов битового и непрерывного представления на одинаковом наборе данных. Устойчивость характеризует изменение кода при малых отклонениях входного значения около границ термов. Вычислительный эксперимент должен фиксировать время преобразования, объем памяти и скорость основных операций сравнения и агрегирования. Значения зависят от аппаратной платформы и реализации, поэтому их следует приводить вместе с описанием среды и размера выборки. Без такой информации утверждение о производительности не является воспроизводимым. Содержательная верификация проводится с участием эксперта предметной области. Необходимо проверить, что выбранные термы, пороги и правила агрегирования соответствуют смыслу показателя и не создают искусственных разрывов. Например, соседние значения агрономического показателя не должны получать радикально различную интерпретацию только из-за неудачно выбранной границы квантования. Для интеграции в цифровую платформу важны версионирование схем фазификации и прослеживаемость. Код B(x) должен сопровождаться идентификатором набора термов и порогов, иначе сравнение записей, сформированных по разным версиям правил, станет некорректным. Платформа должна сохранять исходное значение либо ссылку на него, чтобы результат можно было проверить и при необходимости пересчитать. Метод целесообразно применять там, где требуется массовое сопоставление объектов по лингвистически интерпретируемым признакам: предварительное ранжирование хозяйств, фильтрация сигналов мониторинга, поиск сходных ситуаций и формирование групп риска. В задачах, требующих высокой точности непрерывного вывода, битовый код должен использоваться как вспомогательное, а не единственное представление. Заключение Для цифровых платформ АПК характерно противоречие между необходимостью интерпретируемой обработки неопределенной информации и требованиями к массовым высокопроизводительным вычислениям. Фазификация позволяет сохранить лингвистический смысл оценок, однако классические вещественные Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 71 представления могут быть избыточными при больших массивах однотипных операций. Дискретное, в том числе битовое, кодирование фазифицированных признаков представляет перспективное направление, позволяющее ускорить сравнение и агрегирование при сохранении контролируемой точности. Дальнейшая работа должна включать формализацию правил дискретизации и вычислительный эксперимент на данных сельскохозяйственных объектов. Источники: 1. Zadeh L. A. Fuzzy Sets // Information and Control. 1965. Vol. 8, No. 3. P. 338–353. DOI: 10.1016/S0019-9958(65)90241-X. 2. Mamdani E. H., Assilian S. An Experiment in Linguistic Synthesis with a Fuzzy Logic Controller // International Journal of Man-Machine Studies. 1975. Vol. 7, No. 1. P. 1–13. DOI: 10.1016/S0020- 7373(75)80002-2. 3. Klir G. J., Yuan B. Fuzzy Sets and Fuzzy Logic: Theory and Applications. Upper Saddle River: Prentice Hall, 1995. 574 p. 4. Zimmermann H.-J. Fuzzy Set Theory—and Its Applications. 4th ed. Boston: Kluwer Academic Publishers, 2001. 514 p. 5. Меденников В. И. Цифровая онтологическая интеграция базовых цифровых платформ в экосистеме АПК // Управление рисками в АПК. 2020. № 4(38). С. 7–21. DOI: 10.53988/24136573-2020-04-01. 6. Меденников В. И. Цифровая платформа управления как составная часть цифровой экосистемы АПК // Управление рисками в АПК. 2021. № 3(41). С. 26–38. DOI: 10.53988/24136573-2021-03-03. 7. McFadden J., Casalini F., Griffin T., Antón J. The Digitalisation of Agriculture: A Literature Review and Emerging Policy Issues // OECD Food, Agriculture and Fisheries Papers. 2022. No. 176. DOI: 10.1787/285cc27d-en. References: 1. Zadeh L.A. Fuzzy Sets. Information and Control. 1965, 8(3):338–353. DOI: 10.1016/S0019- 9958(65)90241-X. 2. Mamdani E.H., Assilian S. An Experiment in Linguistic Synthesis with a Fuzzy Logic Controller. International Journal of Man-Machine Studies. 1975, 7(1):1–13. DOI: 10.1016/S0020-7373(75)80002- 2. 3. Klir G.J., Yuan B. Fuzzy Sets and Fuzzy Logic: Theory and Applications. Upper Saddle River: Prentice Hall, 1995. 4. Zimmermann H.-J. Fuzzy Set Theory—and Its Applications. 4th ed. Boston: Kluwer Academic Publishers, 2001. 5. Medennikov V.I. Digital ontological integration of basic digital platforms in the agricultural ecosystem. Agricultural Risk Management. 2020, 4(38):7–21. DOI: 10.53988/24136573-2020-04-01. (In Russian). 6. Medennikov V.I. Digital management platform as part of the digital ecosystem of the agro- industrial complex. Agricultural Risk Management. 2021, 3(41):26–38. DOI: 10.53988/24136573- 2021-03-03. (In Russian). 7. McFadden J., Casalini F., Griffin T., Antón J. The Digitalisation of Agriculture: A Literature Review and Emerging Policy Issues. OECD Food, Agriculture and Fisheries Papers. 2022, (176). DOI: 10.1787/285cc27d-en. Журнал «Управление рисками в АПК». Выпуск 3 (45). 2022 www.agrorisk.ru 72