Классификация гиперспектральных изображений – от традиционных к глубоким моделям: обзор для будущих перспектив

Мухаммад Ахмад, Сидра Шаббир, Свалпа Кумар Рой, Даньфэн Хун, Синь Ву, Цзин Яо, Адил Мехмуд Хан, Мануэль Маццара, Сальваторе Дистефано и Джоселин Шанюссо
Аннотация – Гиперспектральная визуализация (HSI) широко используется во многих реальных приложениях благодаря детальной спектральной информации, содержащейся в каждом пикселе. Следует отметить, что сложные характеристики, т.е. нелинейная связь между регистрируемой спектральной информацией и соответствующим объектом данных HSI, делают точную классификацию сложной для традиционных методов. За последние несколько лет глубокое обучение (DL) было признано мощным средством извлечения признаков, которое эффективно решает нелинейные задачи, встречающиеся в ряде задач компьютерного зрения. Это стимулирует применение DL для классификации гиперспектральных изображений (HSIC), что продемонстрировало хорошие результаты. Данный обзор представляет систематический обзор DL для HSIC и сравнивает современные стратегии по указанной теме. В первую очередь мы обобщим основные проблемы традиционного машинного обучения для HSIC, а затем ознакомим с преимуществами DL для решения этих проблем. Данный обзор разбивает современные DL-фреймворки на спектральные признаки, пространственные признаки и совместные пространственно-спектральные признаки для систематического анализа достижений (а также будущих направлений исследований) этих фреймворков для HSIC. Кроме того, мы учтём тот факт, что DL требует большого количества размеченных обучающих примеров, тогда как получение такого количества для HSIC сложно с точки зрения времени и затрат. Поэтому в данном обзоре обсуждаются некоторые стратегии улучшения обобщающей способности DL-стратегий, которые могут послужить ориентиром для будущих исследований.
Индексные термины – Гиперспектральная визуализация (HSI), классификация гиперспектральных изображений (HSIC), глубокое обучение (DL), извлечение признаков, спектрально-пространственная информация.
Рис. 1: Различные реальные применения HSI.
I. ВВЕДЕНИЕ
Извлечение значимой информации на основе излучения, получаемого сенсором на малых или больших расстояниях без существенного контакта с объектом интереса [1]. HSI предоставляет детальную спектральную информацию путём выборки отражательной части электромагнитного спектра, охватывающей широкий диапазон 0.4−2.4 мкм0.4−2.4мкм (т.е. от видимой области 0.4−0.7 мкм0.4−0.7мкм до коротковолновой инфракрасной области 0.7−2.4 мкм0.7−2.4мкм в сотнях узких и смежных спектральных каналов). HSI также может исследовать свойства излучения (света) объектов в диапазоне среднего и длинного инфракрасного излучения [2].
Несмотря на детальную информацию, это создаёт ряд проблем, поскольку традиционные методы анализа для монохроматических, RGB и мультиспектральных изображений не могут быть непосредственно использованы для извлечения значимой информации из гиперспектральных изображений по нескольким причинам, например, HSI демонстрирует уникальные статистические и геометрические свойства высокоразмерных спектральных/пространственных данных, т.е. объём гиперкуба и гиперсферы концентрируется на углах и внешних оболочках соответственно.
HSI применяется во многих реальных приложениях, включая, но не ограничиваясь: атмосфера, экология, городские территории, сельское хозяйство, геология и разведка полезных ископаемых, прибрежная зона, морская среда, лесное хозяйство (т.е. отслеживание здоровья лесов), качество воды и загрязнение поверхности, внутренние воды и водно-болотные угодья, снег и лёд, биологические и медицинские контексты. Существуют также военные приложения в области маскировки, обнаружения мин и картографирования прибрежной зоны. Кроме того, HSI используется в космических, воздушных и подводных аппаратах для получения детальной спектральной информации для широкого круга задач [3]–[5].
Сбор полевых данных и индексация спектральных библиотек эталонных сигнатур для любого из указанных приложений критичны по многим причинам. Например, спектральная информация растительности подвержена влиянию широкого диапазона условий окружающей среды, что делает затруднительным удовлетворительное представление изменчивости без сбора полевых спектров для конкретного участка. Но реальный потенциал HSI в основном остаётся неиспользованным, поскольку он позволяет проникать глубже поверхностных признаков, учитывая, что обычно каждый признак имеет свой спектральный диапазон. Действительно, HSI может регистрировать более 200 спектральных каналов, что помогает практикам различать объекты, которые ранее были недоступны. Несколько примеров применения HSI показаны на Рис. 1, но многие другие области (например, умные города, Индустрия 4.0, интеллектуальные транспортные системы) могут значительно выиграть от такого подхода.
Учитывая вышеупомянутые ограничения, анализ HSI подразделяется на следующие основные направления: снижение размерности [6]–[10], спектральное разделение [11]–[17], обнаружение объектов/изменений [18]–[22], классификация [23]–[26], извлечение признаков для классификации [27]–[30], восстановление и шумоподавление [31], [32], повышение разрешения [33], [34]. Рисунок 2 показывает экспоненциально растущую тенденцию в литературе, публикуемой ежегодно по задачам и приложениям, связанным с анализом HSI.
В данном обзоре мы сосредоточимся конкретно на классификации данных HSI (HSIC), которая вызвала огромный интерес исследовательского сообщества благодаря широкому применению в областях землепользования и земельного покрова [35]–[39], мониторинга окружающей среды и обнаружения природных опасностей [40], [41], картографирования растительности [42], [43] и городского планирования. Методологии HSIC используют алгоритмы машинного обучения для выполнения задачи классификации [44], [45]. Эти методы освещены в различных обзорах, опубликованных в течение/за последнее десятилетие [23], [46]–[54]. Тем не менее, непрерывные достижения в области машинного обучения предоставляют улучшенные методы время от времени. Модели глубокого обучения (DL) являются одним из таких революционных достижений в машинном обучении, которые повысили точность HSIC [24], [55]–[57].
Цель данного обзора – дать обзор широко используемых методов на основе DL для выполнения HSIC. В частности, мы сначала суммируем основные проблемы HSIC, которые не могут быть эффективно преодолены традиционным машинным обучением (TML), а затем перечислим преимущества DL для решения вышеупомянутых проблем. На более позднем этапе мы предоставим структуру для категоризации соответствующих работ среди:
  1. спектральное и пространственное извлечение признаков по отдельности, и
  2. спектрально-пространственное извлечение признаков для систематического обзора достижений в HSIC на основе DL.
  3. Будущие исследования направлены на улучшение обобщающей способности и устойчивости DL-моделей с учётом ограниченной доступности надёжных обучающих выборок.
Остальная часть этой статьи структурирована следующим образом. Раздел II знакомит с задачей классификации HSI (HSIC) и кратко обсуждает сдвиг парадигмы HSIC от традиционного (обычного) машинного обучения к моделям глубокого обучения (DL), описывая характеристики данных HSI, а также преимущества и ограничения DL, с которыми сталкиваются при работе с HSI. В разделах III и IV даётся обзор различных форм представления HSI и основных стратегий машинного обучения соответственно. В разделе V описываются несколько часто используемых типов слоёв и рассматриваются последние разработки (особенно с 2017 года) некоторых интенсивно используемых DL-фреймворков для HSIC. Разделы VI, VII, VIII и IX представляют современные разработки свёрточных нейронных сетей (CNN), графовых CNN (GCNN), автокодировщиков (AE), глубоких сетей доверия (DBN), рекуррентных нейронных сетей (RNN) соответственно. В разделе X мы кратко обсуждаем различные стратегии преодоления низкой обобщающей способности HSIC из-за ограниченной доступности обучающих данных. Раздел XI представляет экспериментальные результаты и обсуждение результатов, полученных с использованием различных стратегий глубокого обучения. Раздел XII завершает статью несколькими будущими направлениями исследований, связанными с совместным использованием спектрально-пространственных признаков HSI, ограниченными обучающими данными и вычислительной сложностью.
Рис. 2: Количество статей, связанных с HSI, опубликованных за год до 25 сентября 2021 г. [Источник: Google Scholar, доступ 25 сентября 2021 г., результаты (включая патенты и цитирования) отсортированы по релевантности].
II. КЛАССИФИКАЦИЯ ГИПЕРСПЕКТРАЛЬНЫХ ИЗОБРАЖЕНИЙ (ОСНОВЫ И ПРОБЛЕМЫ)
A. От традиционных моделей к DL
Основная задача HSIC – присвоить уникальную метку каждому вектору пикселя гиперспектрального куба на основе его спектральных или спектрально-пространственных свойств. Математически гиперспектральный куб может быть представлен как X=[x1,x2,x3,…,xB]T∈RB×(N×M)X=[x1​,x2​,x3​,…,xB​]T∈RB×(N×M), где BB представляет общее количество спектральных каналов, состоящих из (N×M)(N×M) отсчётов на канал, принадлежащих YY классам, где xi=[x1,i,x2,i,x3,i,…,xB,i]Txi​=[x1,i​,x2,i​,x3,i​,…,xB,i​]T – ii-й образец в гиперспектральном кубе с меткой класса yi∈RYyi​∈RY. Задача классификации может рассматриваться как оптимизационная, в которой функция отображения fc(.)fc​(.) принимает входные данные XX и после применения некоторых преобразований получает соответствующую метку YY, чтобы уменьшить разрыв между полученным выходом и фактическим [58].
где θθ – определённый настраиваемый параметр, который может потребоваться для применения преобразований к входным данным XX, таких что fc:X→Yfc​:XY.
В литературе проделана значительная работа по HSIC, и наблюдается растущая тенденция в разработке таких методов, как показано на Рисунке 3. Большинство фреймворков HSIC, по-видимому, находятся под влиянием методологий, используемых в области компьютерного зрения [59]. Подходы HSIC на основе традиционного машинного обучения используют ручные (handcrafted) признаки для обучения классификатора. Эти методы обычно полагаются на использование инженерных навыков и знаний в предметной области для разработки различных признаков, созданных человеком, например, форма, текстура, цвет, форма, спектральные и пространственные детали. Все эти признаки являются основными характеристиками изображения и несут эффективную информацию для классификации изображений. Обычно используемые методы извлечения ручных признаков и классификации включают: дескрипторы текстуры, такие как локальные бинарные шаблоны (LBP) [60], гистограммы ориентированных градиентов (HOG) [61], глобальное преобразование масштабируемых инвариантных признаков / глобальное инвариантное масштабируемое преобразование (GIST) [62], пирамида гистограмм ориентированных градиентов (PHOG), преобразование масштабно-инвариантных признаков (SIFT) [63], случайные леса [64], машины опорных векторов на основе ядер (SVM) [65], метод K-ближайших соседей (KNN) и экстремальное машинное обучение (ELM).
Гистограммы цветов – это простые и эффективные ручные признаки, используемые для классификации изображений. Их легко вычислить, и они инвариантны к небольшим изменениям в изображениях, например, к переносу и повороту. Основным недостатком цветовой гистограммы является то, что она не предоставляет пространственной контекстной информации, поэтому становится трудно различать объекты одного цвета, но разного распределения. Кроме того, цветовые гистограммы чувствительны к изменению освещённости. Признаки HOG представляют гистограмму ориентаций градиентов пространственных субрегионов. Они могут эффективно извлекать информацию о краях и локальной форме и использовались в различных работах, связанных с дистанционным зондированием [35], [66], [67].
Преобразование масштабно-инвариантных признаков (SIFT) – широко используемый устойчивый дескриптор признаков, применяемый к задачам классификации изображений [68]–[71]. Преимущество дескриптора SIFT в том, что он инвариантен к изменению масштаба изображения, повороту, освещённости и шуму. SIFT используется для извлечения локальных признаков, описывающих конкретную точку в изображении. Недостаток SIFT – его математическая сложность, увеличивающая вычислительные затраты. GIST представляет глобальное описание важных аспектов изображения, таких как масштабы и ориентации (градиентная информация) различных субрегионов изображения. GIST строит пространственную оболочку в терминах различных статистических свойств, таких как шероховатость, открытость и неровность и т.д. [72]. Дескрипторы текстуры, такие как локальные бинарные шаблоны (LBP), используются для анализа изображений дистанционного зондирования [60], [73]. LBP используются для описания текстуры вокруг каждого пикселя путём выбора пикселей из квадратной окрестности, и значения уровней серого всех пикселей окрестности порогово обрабатываются относительно центрального пикселя.
Гистограммы цветов, GIST и дескрипторы текстуры являются глобальными признаками, которые представляют определённые статистические характеристики изображения, такие как цвет, текстура [74], [75] и пространственная структура [62]. В то время как HOG и SIFT являются локальными признаками, описывающими геометрическую информацию. Обычно они используются для построения моделей мешка визуальных слов (BoVW) [36], [37], [41], [71], [76]–[81] и моделей на основе признаков HOG [35], [82]. Некоторые популярные стратегии кодирования или агрегирования признаков для повышения производительности BoVW – это кодирование векторов Фишера [60], [83], [84], пространственное пирамидальное сопоставление (SPM) [85] и вероятностная тематическая модель (PTM) [81], [86]–[88]. Одного признака недостаточно для представления всей информации об изображении, поэтому для классификации изображений используется комбинация этих признаков [36], [76], [86], [88]–[95].
Ручные признаки могут эффективно представлять различные атрибуты изображения, поэтому хорошо работают с анализируемыми данными. Однако эти признаки могут быть несущественными в случае реальных данных, поэтому трудно добиться тонкого баланса между устойчивостью и различимостью, поскольку оптимальный набор признаков значительно варьируется между разными данными. Кроме того, участие человека в разработке признаков существенно влияет на процесс классификации, так как требует высокого уровня знаний в предметной области для разработки ручных признаков.
Чтобы смягчить ограничения разработки ручных признаков, в 2006 году Хинтон и Салахудинов предложили стратегию глубокого извлечения признаков [96]. Методы на основе глубокого обучения (DL) могут автоматически извлекать признаки из данных иерархическим образом, строя модель с возрастающими семантическими уровнями до достижения подходящего представления. Такие модели показали большой потенциал для представления признаков в классификации изображений дистанционного зондирования [97], [98].
DL-архитектуры могут изучать поведение любых данных без предварительных знаний о статистическом распределении входных данных [99] и могут извлекать как линейные, так и нелинейные признаки входных данных без какой-либо предварительно заданной информации. Такие системы способны обрабатывать данные HSI как в спектральной, так и в пространственной области по отдельности, а также в объединённом виде. DL-системы обладают гибкой архитектурой в отношении типов слоёв и их глубины и адаптируются к различным стратегиям машинного обучения, таким как обучение с учителем, полуавтоматическое и без учителя.
B. Характеристики гиперспектральных данных и проблемы DL
Несмотря на вышеупомянутые возможности DL, всё ещё существуют некоторые проблемы, которые необходимо учитывать при применении DL к данным HSI. Большинство этих проблем связано с характеристиками данных HSI, т.е. сотнями смежных и узких спектральных каналов с очень высоким спектральным разрешением и низким пространственным разрешением в электромагнитном спектре, а также ограниченной доступностью обучающих данных. Хотя пиксели с богатой спектральной информацией полезны для классификации, однако вычисление таких данных требует много времени и ресурсов.
Кроме того, обработка таких высокоразмерных данных является довольно сложной задачей из-за увеличенного числа параметров. Это известно как проклятие размерности, которое значительно влияет на эффективность классификации, особенно в случае обучения с учителем [100]. Поскольку размер обучающих данных недостаточен/неадекватен и/или не надёжен (т.е. обучающие выборки могут не давать модели новой информации или могут иметь похожие структуры/шаблоны) для правильного обучения классификатора, это может привести к переобучению модели. Это известно как явление Хьюза [101], которое возникает, когда размеченных обучающих данных значительно меньше, чем число спектральных каналов в данных. Недостаток размеченных данных HSI является серьёзной проблемой в HSIC, так как разметка HSI – трудоёмкая и дорогая задача, поскольку обычно требует участия экспертов-людей или исследования сценариев реального времени.
В дополнение к высокой размерности, HSIC страдает от различных других артефактов, таких как высокая внутриклассовая изменчивость из-за неограниченных вариаций значений отражения, вызванных несколькими факторами окружающей среды, и ухудшение данных, вызванное инструментальным шумом при захвате данных [102]. Кроме того, добавление избыточных каналов из-за приборов HSI влияет на вычислительную сложность модели. Спектральное смешивание – ещё одна проблема, связанная с пространственным разрешением HSI. Пиксели HSI с низким или средним пространственным разрешением покрывают обширные пространственные области на поверхности Земли, приводя к смешанным спектральным сигнатурам, что приводит к высокому межклассовому сходству в пограничных областях. В результате становится трудно идентифицировать материалы на основе их спектральных значений отражения [103]. Ниже приведены некоторые основные проблемы, возникающие при применении DL к HSIC:
  • Сложный процесс обучения: Обучение глубокой нейронной сети (DNN) и оптимизация путём настройки параметров является NP-полной задачей, где сходимость процесса оптимизации не гарантирована [104]–[106]. Поэтому предполагается, что обучение DNN очень сложно [99], особенно в случае HSI, когда необходимо настраивать большое количество параметров. Однако задача сходимости становится несколько легче благодаря развитию различных методов оптимизации для глубоких CNN. Среди стохастического градиентного спуска (SGD) [107] и его версии с импульсом (SGDM) [108], RMSProp [109], Adam [110], AdamW [111], diffGrad [112], RAdam [113], градиентной централизации (GC) [114], AngularGrad [115] соответственно являются успешными методами оптимизации CNN и широко используются в любых задачах классификации.
  • Ограниченная доступность обучающих данных: Как обсуждалось выше, контролируемая DNN требует значительно большого объёма обучающих данных, в противном случае их склонность к переобучению значительно возрастает [116], что приводит к явлению Хьюза. Высокоразмерная характеристика HSI в сочетании с небольшим объёмом размеченных обучающих данных делает DNN неэффективными для HSIC, так как это требует множества настроек во время фазы обучения [58].
  • Интерпретируемость модели: Процесс обучения DNN трудно интерпретировать и понять. Природа «чёрного ящика» считается потенциальной слабостью DNN и может повлиять на проектные решения процесса оптимизации. Хотя проделана большая работа по интерпретации внутренней динамики модели.
  • Высокая вычислительная нагрузка: Одна из основных проблем DNN – работа с большим объёмом данных, что требует увеличенной пропускной способности памяти, высоких вычислительных затрат и потребления памяти [117]. Однако передовые методы обработки, такие как параллельные и распределённые архитектуры [118], [119], и высокопроизводительные вычисления (HPC) [103] позволяют DNN обрабатывать большие объёмы данных.
  • Деградация точности обучения: Предполагается, что более глубокие сети извлекают более богатые признаки из данных [120], однако это не верно для всех систем, чтобы достичь более высокой точности путём простого добавления большего числа слоёв. Потому что при увеличении глубины сети проблема взрывающихся или затухающих градиентов становится более заметной [121] и влияет на сходимость модели [120].
Рис. 4: Гиперспектральный куб.
III. ПРЕДСТАВЛЕНИЕ HSI
Гиперспектральные данные представлены в виде 3D3D гиперкуба, X∈RB×(N×M)X∈RB×(N×M), который содержит 1D1D спектральные и 2D2D пространственные детали образца, где BB представляет общее количество спектральных каналов, а NN и MM – пространственные компоненты, т.е. ширину и высоту соответственно. Гиперспектральный куб показан на Рисунке 4.
A. Спектральное представление
В таких представлениях каждый вектор пикселя изолируется от других пикселей и обрабатывается на основе только спектральных сигнатур, что означает, что пиксель представлен только в спектральном пространстве xi∈RBxi​∈RB. Где BB может быть либо фактическим числом спектральных каналов, либо только релевантными спектральными каналами, извлечёнными после некоторого метода снижения размерности (DR). Обычно вместо исходных спектральных каналов для обработки данных предпочтительнее использовать низкоразмерное представление HSI, чтобы избежать избыточности и достичь лучшей разделимости классов без значительной потери полезной информации.
Подходы к снижению размерности (DR) для спектрального представления HSI могут быть как контролируемыми, так и неконтролируемыми. Неконтролируемые методы преобразуют высокоразмерное HSI в низкоразмерное пространство без использования информации о метках классов, например, метод главных компонент (PCA) и локально-линейное вложение [122]. С другой стороны, контролируемые DR-методы используют размеченные выборки для изучения распределения данных, т.е. для того, чтобы точки данных одного класса были близки друг к другу и разделяли точки данных разных классов. Например, линейный дискриминантный анализ (LDA), локальный дискриминантный анализ Фишера (LFDA) [123], локальное дискриминантное вложение (LDE) [124] и непараметрическое взвешенное извлечение признаков (NWFE) [125]. LDA и LDFA обеспечивают лучшую разделимость классов, максимизируя межклассовое расстояние точек данных и минимизируя внутриклассовое расстояние. Однако из-за эффекта спектрального смешивания, когда один и тот же материал может проявляться с разными спектрами или разные материалы могут иметь одинаковые спектральные сигнатуры, становится трудно различать разные классы только на основе значений спектрального отражения.
B. Пространственное представление
Чтобы справиться с ограничениями спектрального представления, другой подход заключается в использовании пространственной информации пикселей, при которой пиксели в каждом канале представлены в виде матрицы, xi∈RN×Mxi​∈RN×M. Из-за высокой пространственной корреляции соседние пиксели имеют более высокую вероятность принадлежать к одному и тому же классу. Поэтому в случае пространственного представления также учитывается информация соседних пикселей, и окрестность пикселя может быть определена с использованием ядра или центрированного на пикселе окна [126]. Некоторые распространённые методы извлечения пространственной информации из гиперспектрального куба – это морфологические профили (MPs), текстурные признаки (такие как фильтры Габора, матрица совместной встречаемости уровней серого (GLCM) и локальные бинарные шаблоны (LBP) и т.д.) и методы на основе DNN. Морфологические профили способны извлекать геометрические характеристики. Несколько расширений MPs включают расширенные морфологические профили (EMPs) [127], морфологические профили с множественными структурными элементами [128], инвариантные атрибутные профили (IAPs) [129].
Текстура изображения предоставляет полезную пространственную контекстную информацию HSI. Например, фильтр Габора, метод анализа текстуры, может эффективно получать текстурную информацию в различных масштабах и ориентациях. Аналогично, LBP может обеспечить инвариантное к повороту пространственное текстурное представление. GLCM может эффективно определять пространственную изменчивость HSI, используя относительные положения соседних пикселей. DNN также могут извлекать пространственную информацию HSI, рассматривая пиксель как патч изображения вместо представления его как спектрального вектора. Пространственная информация, содержащаяся в HSI, также может быть извлечена путём комбинации различных вышеупомянутых методов. Например, [130] объединили фильтр Габора и дифференциальные морфологические профили [131] для извлечения локальных пространственных последовательных признаков для фреймворка HSIC на основе рекуррентной нейронной сети (RNN).
C. Спектрально-пространственное представление
Это представление совместно использует как спектральную, так и пространственную информацию данных. В таких подходах вектор пикселя обрабатывается на основе спектральных признаков с учётом пространственно-контекстной информации. Стратегии, которые одновременно используют как спектральное, так и пространственное представление HSI, либо объединяют пространственные детали со спектральным вектором [51], [132], либо обрабатывают 3D-куб HSI для сохранения фактической структуры и контекстной информации [133].
В литературе все эти представления HSI широко используются для HSIC. Большинство DNN для попиксельной классификации используют спектральное представление HSI [134], [135]. Однако для смягчения ограничений спектрального представления было предпринято множество попыток включить пространственную информацию [136], [137]. Недавно совместное использование спектральных и пространственных признаков приобрело большую популярность и привело к повышению точности классификации [56], [138]–[142]. Эти подходы к извлечению признаков HSI для HSIC далее обсуждаются в следующих разделах.
IV. СТРАТЕГИИ ОБУЧЕНИЯ
Модели глубокого обучения могут использовать различные стратегии обучения, которые можно широко разделить на следующие:
A. Обучение с учителем
В подходе с учителем модель обучается на основе размеченных обучающих данных, что означает, что обучающие данные состоят из набора входов и соответствующих им выходов или меток классов. Во время фазы обучения модель итеративно обновляет свои параметры, чтобы точно предсказывать желаемые выходы. На фазе тестирования модель проверяется на новых входных/тестовых данных для проверки её способности предсказывать правильные метки. При достаточном обучении модель может предсказывать метки новых входных данных. Однако обучение DNN с учителем требует большого количества размеченных обучающих данных для точной настройки параметров модели. Поэтому они лучше всего подходят для сценариев, где доступно много размеченных данных. Подробности о различных методах обучения с учителем для DNN будут объяснены в соответствующих разделах.
B. Обучение без учителя
В отличие от подхода с учителем, методы обучения без учителя учатся на входных данных без явных меток, связанных с ними. Эти подходы пытаются выявить статистическую структуру входных представлений или закономерности в отсутствие соответствующих меток. Поскольку для обучающих данных нет эталонных меток, может быть трудно измерить точность обученной модели. Однако такие стратегии обучения полезны в случаях, когда мы хотим изучить внутреннюю структуру наборов данных, для которых существует дефицит обучающих данных. Метод главных компонент (PCA) является методом обучения без учителя, который может использоваться для изучения низкоразмерного представления входа. Аналогично, кластеризация k-средних – ещё один метод обучения без учителя, который группирует входные данные в однородные кластеры.
C. Полуавтоматическое обучение
Метод полуавтоматического обучения (semi-supervised) находится между подходами без учителя и с учителем. Он учится на частично размеченных наборах данных, т.е. небольшое количество размеченных обучающих данных может быть использовано для разметки остальных неразмеченных данных. Эти методы эффективно используют все доступные данные вместо только размеченных, поэтому они приобрели большую популярность среди исследовательского сообщества и широко используются для HSIC [143]–[146]. Подробности этих методов кратко описаны в разделе X.
V. РАЗВИТИЕ DNN (ТИПЫ СЛОЁВ)
В следующем разделе мы рассматриваем последние разработки некоторых широко используемых DNN-фреймворков для HSIC. Мы конкретно проанализировали литературу, опубликованную с 2017 года. DNN демонстрируют большое разнообразие гибких и настраиваемых моделей для HSIC, которые позволяют включать несколько типов слоёв. Несколько широко используемых типов слоёв объясняются ниже.
Слой является ключевым строительным блоком DNN, и тип слоя имеет решающее влияние с точки зрения обработки признаков. Слой принимает взвешенный вход, обрабатывает его через линейное или нелинейное преобразование и передаёт эти значения на следующий слой. Обычно слой является однородным, так как имеет одну функцию активации. Первый слой сети известен как входной слой, а последний – как выходной. Все остальные слои в сети, между входным и выходным слоями, известны как скрытые слои. Эти слои постепенно находят различные признаки во входных данных, выполняя различные преобразования. Выбор типа слоя зависит от решаемой задачи, так как некоторые слои работают лучше для одних задач, чем для других. Наиболее часто используемые слои для HSIC объяснены ниже.
A. Полносвязные слои
Полносвязный (FC) слой соединяет каждый нейрон в нижнем слое с каждым нейроном в верхнем/следующем слое. В основном они используются в качестве последних нескольких слоёв модели, обычно после слоёв свёртки/субдискретизации. FC принимает выход предыдущего слоя и присваивает веса для предсказания вероятностей меток классов. Из-за большого числа соединений необходимо настраивать большое количество параметров, что значительно увеличивает вычислительные затраты. Кроме того, из-за большого числа параметров модель становится более чувствительной к переобучению [38]. Однако для смягчения эффекта переобучения в [147] был предложен метод dropout.
B. Свёрточные слои
Свёрточный (CONV) слой выполняет свёртку входных данных или карт признаков из нижнего слоя с фильтрами (ядрами). Фильтр содержит веса, скалярное произведение которых вычисляется с подмножеством входных данных путём перемещения по ширине, высоте и глубине входной области. Выход фильтра известен как карта признаков. CONV-слой обеспечивает пространственную инвариантность через подход локальной связности, при котором нейрон в карте признаков соединяется с подмножеством входных данных из предыдущего слоя, а не с каждым нейроном. Это уменьшает количество параметров, которые необходимо обучать. Чтобы дополнительно уменьшить количество параметров, CONV-слой использует механизм совместного использования параметров, при котором одни и те же веса используются в конкретной карте признаков.
C. Активационные слои
Активационные слои считаются этапом детектора признаков DNN [148]. FC и CONV слои обеспечивают линейные представления входных данных, или можно сказать, что они работают аналогично линейным регрессорам, и данные, преобразованные этими слоями, считаются находящимися на этапе извлечения признаков [58]. Поэтому для изучения нелинейных признаков данных после FC и CONV слоёв необходимо использовать активационный слой. В активационном слое карты признаков из предыдущих слоёв проходят через функцию активации для формирования карты активации. Некоторые часто используемые функции активации – сигмоид, гиперболический тангенс (tanh), выпрямленный линейный блок (ReLU), LiSHT [149] и softmax. Однако в анализе HSI softmax и ReLU являются широко используемыми функциями активации [58]. На Рисунке 5 представлено графическое изображение нескольких часто используемых функций активации.
Рис. 5: Графическое представление различных часто используемых функций активации.
Рис. 6: Операции max-pooling и average-pooling слоя субдискретизации/пулинга.
D. Слои пулинга или субдискретизации
Слой пулинга, также известный как слой субдискретизации или понижающей дискретизации, принимает некоторый входной объём и уменьшает его до одного значения, как показано на Рисунке 6. Это обеспечивает инвариантность к небольшим искажениям в данных. Слой пулинга помогает модели контролировать переобучение, так как размер данных и параметров модели уменьшаются, что также приводит к снижению вычислительного времени. Обычно используемые операции понижающей дискретизации – это max-pooling, average-pooling и sum-pooling. Недавно в [150] была представлена техника пулинга на основе вейвлетов, производительность которой сопоставима с max-pooling и average-pooling. Альтернативно, [151] предложил другой тренд, в котором слой пулинга заменяется CONV-слоем с увеличенным шагом фильтра.
VI. СВЁРТОЧНАЯ НЕЙРОННАЯ СЕТЬ (CNN)
Архитектура свёрточной нейронной сети (CNN) вдохновлена биологической зрительной системой, представленной в [152]. Следуя естественному механизму визуального распознавания, предложенному Хьюбелом и Визелом [152], неокогнитрон [153] считается первой иерархической, позиционно-инвариантной моделью для распознавания образов [154], которую можно считать предшественником CNN [155]. Архитектуру CNN можно разделить на два основных этапа: один – сеть извлечения признаков (FE), а другой – классификация на основе карт признаков, извлечённых на первом этапе.
Сеть FE состоит из множества иерархически сложенных CONV, активационных и пулинговых слоёв. CONV-слой извлекает признаки из входных данных путём свёртки с изученным ядром. На каждом CONV-слое ядро разделяется пространственно со всеми входными данными, что уменьшает сложность модели, и сеть становится легче обучать, так как количество параметров, которые нужно настраивать, уменьшается. Результаты свёртки затем проходят через активационный слой, который добавляет нелинейности в сеть для извлечения нелинейных признаков входа. Это достигается применением нелинейной функции к результатам свёртки. После этого разрешение карты признаков уменьшается путём применения операции пулинга для достижения инвариантности к сдвигу. Обычно слой пулинга добавляется с каждым CONV-слоем, за которым следует функция активации.
Этап классификации, состоящий из FC-слоёв и оператора Softmax, даёт вероятность принадлежности входного шаблона к определённому классу на основе карт признаков, извлечённых на этапе FE. FC-слой соединяет каждый нейрон в предыдущем слое с каждым нейроном в текущем слое. В [156] и [157] авторы предложили, что от FC-слоя можно отказаться, используя глобальный слой среднего пулинга. Softmax обычно используется для задач классификации [158], [159], однако многие работы также использовали SVM [160], [161] для этой цели.
В следующем разделе мы рассматриваем три типа CNN-архитектур для HSIC: i) спектральные CNN, ii) пространственные CNN и iii) спектрально-пространственные CNN. На Рисунке 7 показана общая архитектура этих трёх фреймворков.
A. Спектральные CNN-фреймворки для HSIC
Спектральные CNN-модели учитывают только 1D1D спектральную информацию (xi∈RB)(xi​∈RB) в качестве входа, где BB может быть либо исходным количеством спектральных каналов, либо соответствующим количеством каналов, извлечённым после некоторого метода снижения размерности. В [162] была предложена CNN-структура для смягчения проблемы переобучения и достижения лучшей обобщающей способности путём использования свёрточных ядер 1×11×1 и повышенных коэффициентов dropout. Кроме того, глобальный слой среднего пулинга используется вместо полносвязного слоя для уменьшения параметров сети. Чтобы уменьшить высокую корреляцию между каналами HSI, [157] предложили CNN-архитектуру для HSIC, которая полностью использует спектральную информацию, преобразуя 1D1D спектральный вектор в 2D2D матрицу признаков и каскадируя составные слои, состоящие из CONV-слоёв 1×11×1 и 3×33×3, архитектура достигла возможности повторного использования признаков. Аналогично [162], [157] также использовали глобальный слой среднего пулинга для уменьшения параметров обучения сети и извлечения высокоразмерных признаков.
В [163] авторы представили гибридную модель для HSIC, в которой первые несколько CONV-слоёв используются для извлечения позиционно-инвариантных признаков среднего уровня, а затем рекуррентные слои используются для извлечения спектрально-контекстных деталей. Аналогично, [134] использовали гибридную архитектуру для классификации здоровых и больных колосьев пшеницы. Для входного слоя они преобразуют спектральную информацию в 2D2D структуру данных. В [164] CNN показала большую эффективность по сравнению с SVM и KNN для спектральной идентификации сортов рисовых семян. Подобное применение CNN было исследовано в [135], где различные сорта хризантем были идентифицированы с использованием спектральных данных первых пяти главных компонент PCA. PCA – это метод снижения размерности, широко используемый во многих DL-приложениях для обработки/предварительной обработки высокоразмерных данных. В [165] PCA использовалась для предварительной обработки медицинских HSI, а затем для классификации использовалось объединение ядер CNN с ядрами Габора с использованием скалярного произведения.
В исследовании [166] анализировался ещё один метод снижения размерности – динамическое разложение по модам (DMD), который преобразует 3D3D HSI-данные в 2D2D, а затем эти данные подаются в векторизованную CNN (VCNN) для классификации. Чтобы преодолеть влияние шума в попиксельной HSIC, в [167] используется метод усреднённых спектров, где усреднённый спектр группы пикселей, принадлежащих бактериальным колониям, извлекается для дальнейшего анализа.
B. Пространственные CNN-фреймворки для HSIC
Пространственные CNN-модели учитывают только пространственную информацию, и для извлечения пространственной информации из данных HSI применяются методы снижения размерности (DR) в спектральной области для уменьшения размерности исходных данных HSI. Например, [168] использовал PCA для извлечения первой главной компоненты с уточнённой пространственной информацией и подал её в полносвёрточную CNN-фреймворк для классификации. Аналогично, [169] обучил пространственную 2D2D CNN с одной главной компонентой. В [170] данные PCA-отбеленные с учётом трёх главных компонент подаются в сеть случайных патчей как 2D2D CNN-фреймворк классификации.
Метод, предложенный в [171], вырезает патчи из 2D2D входных изображений (т.е. изображений из разных спектральных каналов) для обучения 2D2D CNN-архитектуры, которая сама изучает адаптивные к данным ядра. Кроме того, некоторые авторы также предложили использование ручных признаков вместе с уменьшением спектральной размерности. Например, [172] объединили технику фильтрации Габора с 2D2D CNN для HSIC, чтобы преодолеть проблему переобучения из-за ограниченных обучающих выборок. Фильтрация Габора извлекает пространственные детали, включая края и текстуры, что эффективно уменьшает проблему переобучения. Работа [173] предложила деформируемую HSIC-сеть, основанную на концепции деформируемых позиций выборки, которые могут адаптивно регулировать свой размер и форму в соответствии с пространственными признаками HSI. Такие позиции выборки создаются путём вычисления 2D2D смещений для каждого пикселя во входном изображении через обычные свёртки с учётом трёх главных компонент. Эти смещения могут покрывать позиции похожих соседних пикселей, обладающих сходными характеристиками. Затем структурная информация соседних пикселей объединяется для создания деформируемых карт признаков. Обычная свёртка, применяемая к этим деформируемым картам признаков, может извлекать более эффективные сложные структуры.
C. Спектрально-пространственные CNN-фреймворки для HSIC
Спектрально-пространственная попиксельная HSIC может быть достигнута путём интеграции пространственных признаков в спектральную информацию. Например, [174] представили улучшенный подход к парам пиксельных признаков (PPF), называемый пространственным парным пиксельным признаком, который отличается от традиционных PPF в двух основных аспектах: во-первых, выбор пары пикселей – только пиксель из непосредственной окрестности центрального пикселя может использоваться для образования пары; во-вторых, метка пары пикселей соответствует метке центрального пикселя. Чтобы извлечь дискриминационное совместное представление, [175] представили контролируемую спектрально-пространственную остаточную сеть (SSRN), которая использует серию 3D-свёрток в соответствующих спектральных и пространственных остаточных блоках. Эффективная глубокая 3D3D CNN-фреймворк была предложена в [176], которая одновременно использует как спектральную, так и пространственную информацию для HSIC.
Аналогично, чтобы отразить вариации пространственного контекста в различных гиперспектральных патчах, [177] реализовали технику адаптивного обучения весам вместо назначения фиксированных весов для включения пространственных деталей. Кроме того, чтобы сделать свёрточное ядро более гибким, [142] исследовали новый архитектурный дизайн, который может адаптивно находить настраиваемое рецептивное поле, а затем улучшенную спектрально-пространственную остаточную сеть для совместного извлечения признаков. Дискриминационная способность извлечённых признаков может быть дополнительно улучшена путём объединения как максимальных, так и минимальных свёрточных признаков перед нелинейностью ReLU, как сообщалось в [178] для задачи классификации. CNN не могут естественным образом использовать эквивариантность к повороту; [179] ввели эквивариантные представления входных признаков, которые обеспечивают дополнительную устойчивость к пространственному расположению признаков для HSIC.
Более глубокие сети могут страдать от проблем переобучения и затухания градиентов из-за меньшего количества доступных размеченных обучающих выборок, и для преодоления этого недостатка лёгкие CNN привлекают большое внимание в сообществах HSIC. Статья [180] представила сквозную 3D3D лёгкую свёрточную нейронную сеть для решения проблемы ограниченного количества обучающих выборок для классификации HSI. Чтобы уменьшить большой разрыв между огромным количеством обучаемых параметров и ограниченным количеством размеченных выборок, [181] предложили извлекать спектрально-пространственные собственные отображения Шрёдингера (SSSE) совместной спектрально-пространственной информации, а затем дополнительно уменьшать размерность с помощью техники сжатия. Приблизительно 90%90% обучаемых весов от общего числа параметров используются сразу после операции уплощения (flatten), т.е. в полносвязном слое, тогда как оставшиеся только 10%10% весов используются в предыдущих свёрточных слоях всей сети. Чтобы преодолеть это, [182] ввели лёгкую парадигму обучения мешку признаков в сквозную спектрально-пространственную сеть с сжатием и возбуждением и остаточными связями для HSIC.
Морфологические операции, т.е. эрозия и дилатация, являются мощными нелинейными преобразованиями признаков, широко используемыми для сохранения существенных характеристик формы и структурной информации изображения. Вдохновлённые этим, авторы [183] представили новую сквозную морфологическую свёрточную нейронную сеть (MorphCNN) для HSIC, которая использует как спектральные, так и пространственные признаки путём конкатенации выходов спектральных и пространственных морфологических блоков, извлечённых в двухпутном режиме.
Работа [177] предложила двухэтапный фреймворк для совместной спектрально-пространственной HSIC, который может непосредственно извлекать как спектральные, так и пространственные признаки вместо их независимой конкатенации. Первый этап предложенной сети состоит из CNN и нормализации softmax, которые адаптивно изучают веса для входных патчей и извлекают совместные поверхностные признаки. Затем эти поверхностные признаки подаются в сеть стекированного автокодировщика (SAE) для получения глубоких иерархических признаков, а окончательная классификация выполняется с помощью слоя мультиномиальной логистической регрессии (MLR). 3D3D CNN-модель была введена в [184] для совместного извлечения спектрально-пространственных признаков из HSI, а для проверки её производительности проводилось сравнение со спектральными DBN, SAE и 2D2D-пространственной CNN для HSIC. Работа [185] ввела билинейный механизм слияния над двумя ветвями операции сжатия на основе глобального и максимального пулинга, тогда как операция возбуждения выполняется с объединённым выходом операции сжатия.
Работа [186] предложила подход глубокого многомасштабного спектрально-пространственного извлечения признаков для HSIC, который может извлекать эффективные дискриминантные признаки из изображений с высоким пространственным разнообразием. Фреймворк использует полносвёрточную сеть (FCN) для извлечения глубокой пространственной информации, а затем эти признаки объединяются со спектральной информацией с использованием взвешенной стратегии слияния. Наконец, попиксельная классификация выполняется на этих объединённых признаках.
В [187] был реализован двухканальный CNN-фреймворк для спектрально-пространственной HSIC. В предложенном подходе 1D1D-CNN используется для иерархического извлечения спектральных признаков, а 2D2D-CNN – для извлечения иерархических пространственных признаков. Затем эти признаки объединяются для окончательной задачи классификации. Кроме того, для преодоления недостатка обучающих данных и достижения более высокой точности классификации предложенный фреймворк поддерживается методом аугментации данных, который может увеличить обучающие выборки в 6 раз. В [188] многомасштабная 3D3D глубокая CNN вводится для сквозной HSIC, которая может совместно изучать как 1D1D спектральные, так и 2D2D многомасштабные пространственные признаки без каких-либо методов предварительной или постобработки, таких как PCA и т.д. Чтобы уменьшить избыточность каналов или шум в HSI, [189] исследовали новую архитектуру для HSIC, встроив модуль внимания к каналам в традиционный CNN-фреймворк. В исследовании [190] предложена HSIC-архитектура, в которой преобразованные с помощью PCA изображения используются для получения многомасштабных кубов для извлечения ручных признаков с использованием многомасштабных ковариационных карт, которые могут одновременно использовать спектрально-пространственные детали HSI. Затем эти карты используются для обучения традиционной CNN-модели классификации.
Работа [191] объединила CNN с фреймворком HSIC на основе метрического обучения, который сначала использует CNN для извлечения глубокой пространственной информации с использованием первых трёх главных компонент, извлечённых с помощью PCA. Затем, в фреймворке на основе метрического обучения, спектральные и пространственные признаки объединяются для спектрально-пространственного обучения признакам путём встраивания регуляризационного фактора метрического обучения для обучения классификатора (SVM). Аналогично, [192] объединяет CNN на основе многомасштабной свёртки (MS-CNN) с диверсифицированными глубокими метриками на основе детерминантного точечного процесса (DPP) [193] для HSIC (1-D спектральной, 2-D спектрально-пространственной и 3-D спектрально-пространственной). Многомасштабные фильтры используются в CNN для получения многомасштабных признаков, а диверсифицированное метрическое преобразование на основе DPP выполняется для увеличения межклассовой дисперсии и уменьшения внутриклассовой дисперсии, а также улучшения способности представления HSI. Окончательные карты классификации получаются с использованием классификатора softmax.
В недавней работе [194] предложен HSIC-фреймворк для извлечения многомасштабных пространственных признаков путём построения трёхканального виртуального RGB-изображения из HSI вместо извлечения первых трёх главных компонент с помощью PCA. Цель использования трёхканального RGB-изображения – использовать существующие сети, обученные на естественных изображениях, для извлечения пространственных признаков. Для многомасштабного извлечения признаков эти изображения подаются в полносвёрточную сеть. Эти многомасштабные пространственные признаки объединяются и дополнительно соединяются с извлечёнными с помощью PCA спектральными признаками для окончательной классификации с помощью SVM.
Двухканальная (спектральная и пространственная) DNN для HSIC была введена в [195]. Пространственная ветвь состоит из слоя выбора каналов и свёрточной и деконволюционной структуры с пропусками (skip architecture) для извлечения пространственной информации HSI, а в спектральной ветви используется контекстная DNN для извлечения спектральных признаков. Статья [196] представила полуавтоматическую 3D3D CNN с адаптивным выбором каналов для совместного использования спектрально-пространственных признаков, тогда как [197] исследовали сеть автокодировщик-декодер с двойным вниманием для неконтролируемого выбора гиперспектральных каналов, а затем совместное извлечение признаков для предсказания классов земельного покрова. Аналогично, в [198] спектрально-пространственные признаки одновременно используются в неконтролируемом режиме с помощью 3D3D свёрточного автокодировщика. Попиксельная классификация землепользования и земельного покрова (LULC) с использованием традиционных CNN часто страдает от наличия неверных/зашумленных меток в обучающем наборе и может легко переобучаться на шумные метки. Чтобы преодолеть эту проблему точной классификации, [199] предложили лёгкую гетерогенную свёртку ядер (HetConv3D) для классификации HSI с зашумленными метками, эффективно объединяя как спектральные, так и пространственные признаки ядер для создания дискриминационных и инвариантных карт признаков для классификации.
Гибридная 3D−2D3D−2D CNN-архитектура была представлена [200], в которой сначала 3D3D CNN используется для извлечения совместных спектрально-пространственных признаков, а затем 2D2D CNN дополнительно используется для получения более абстрактных пространственных контекстных признаков. В исследовании [201] предложена байесовская HSIC-архитектура, объединяющая CNN с марковским случайным полем. CNN сначала извлекает совместные спектрально-пространственные признаки, а затем на метки классов накладывается гладкий MRF-априор для дальнейшего уточнения пространственных деталей. Свёрточные нейронные сети сильно подвержены переобучению и проблемам затухающих градиентов, и для их преодоления [202] ввели разделяемую сеть внимания. Где входные карты признаков разделяются на несколько групп и расщепляются по размерности каналов, и наконец, маска внимания, кодирующая глобальную контекстную информацию, объединяет их вместе. Недавно в [203] была представлена обобщённая градиентно-централизованная 3D3D свёртка (G2C-Conv3D) для объединения семантической информации уровня интенсивности и детальной информации уровня градиента, извлечённой из исходных HSI во время операций свёртки. Чтобы повысить производительность точной классификации типов земельного покрова, G2C-Conv3D может быть легко встроена в существующие сети извлечения признаков HSI.
D. GCN-фреймворки для HSIC
Графовые свёрточные сети (GCN) [204] привлекают всё большее внимание исследователей в различных областях благодаря своей гибкой и разнообразной архитектуре, способной обрабатывать нерегулярные высокоразмерные данные. Такие свойства дают новые возможности для более эффективной и действенной обработки гиперспектральных данных. В частности, GCN позволяют моделировать связи между данными (или выборками). Соответственно, это естественным образом побуждает нас использовать GCN для захвата пространственных отношений спектральных сигнатур в HSI. Из-за ограничений GCN в построении графов [205], особенно для больших графов (требующих дорогостоящих вычислений), GCN не могут классифицировать или идентифицировать материалы в крупномасштабных гиперспектральных сценах с использованием обычных персональных компьютеров, что приводит к относительно меньшей популярности по сравнению с CNN в HSIC. По этой причине были предприняты некоторые предварительные исследования по использованию GCN в задаче HSIC.
Например, в [206] была предложена GCN второго порядка для HSIC путём моделирования пространственно-спектральных отношений на многообразиях с попыткой снизить вычислительные затраты на графах. Авторы [207] сначала применили методы сегментации суперпикселей к HSI и подали суперпиксели вместо пикселей в GCN. Это позволило обучать GCN на большом количестве пикселей в HSI для задачи классификации земельного покрова. Тем не менее, эти методы по-прежнему не решают проблему GCN по существу. С этой целью Хонг и др. [205] предложили новый мини-GCN. Как следует из названия, мини-GCN обучает GCN в мини-пакетном режиме, аналогично CNN. Предложенный мини-GCN не только эффективно снижает вычислительные затраты, но и позволяет проводить количественное сравнение и объединение с CNN, что даёт FuNet для HSIC.
E. Будущие направления для CNN-основанной HSIC
В предыдущем разделе мы рассмотрели последние разработки CNN для HSIC. Хотя фреймворки HSIC на основе CNN достигли большого успеха с точки зрения производительности классификации, остаётся много аспектов, требующих дальнейшего исследования. Например, необходимо дальнейшее развитие моделей, которые могут совместно использовать пространственную и спектральную информацию для HSIC. Многие из вышеперечисленных фреймворков используют методы снижения размерности для достижения лучшего спектрально-пространственного представления, но такие подходы отбрасывают полезную спектральную информацию HSI. Следовательно, требуется разработка устойчивых HSIC-подходов, которые могут сохранять спектральную информацию. Однако обработка таких подходов увеличивает вычислительную нагрузку, и процесс обучения становится медленнее, поэтому желательна параллельная обработка таких сетей с использованием FPGA и GPU для достижения вычислительно быстрых моделей, которые могли бы быть даже пригодны для мобильных платформ, без ухудшения производительности.
Кроме того, поскольку CNN становятся всё глубже, для точной классификации требуется больше размеченных обучающих данных, а как обсуждалось ранее, в HSI существует недостаток размеченных обучающих данных. Чтобы преодолеть эту проблему, необходимо больше исследований по интеграции CNN с неконтролируемыми или полуавтоматическими подходами. Кроме того, мы должны уделять больше внимания обобщающей способности CNN, особенно для формата входных данных (не только ограничиваясь сетчатыми данными). GCN могут быть хорошим решением для объединения с CNN для разработки более общего нового фреймворка на основе CNN. Используя это, мы надеемся преодолеть узкое место производительности, получив более эффективную HSIC.
VII. АВТОКОДИРОВЩИКИ (AE)
Автокодировщик (AE) – это популярная симметричная нейронная сеть для HSIC благодаря своей способности к обучению признаков без учителя. AE сам по себе не выполняет задачу классификации, вместо этого он даёт сжатое представление признаков высокоразмерных данных HSI. AE состоит из входного слоя, одного скрытого или кодирующего слоя, одного слоя реконструкции или декодирования и выходного слоя, как показано на Рисунке 8. AE обучается на входных данных таким образом, чтобы кодировать их в скрытое представление, которое может восстановить вход. Чтобы изучить сжатое представление признаков входных данных, AE пытается уменьшить ошибку реконструкции, т.е. минимизировать разницу между входом и выходом.
В то время как стекированный автокодировщик (SAE) строится путём наложения нескольких слоёв AE таким образом, что выход одного слоя служит входом для последующего слоя. Шумоподавляющий автокодировщик (DAE) является вариантом AE, имеющим аналогичную структуру, за исключением входных данных. В DAE вход искажается добавлением шума, однако выходом является исходный сигнал без шума. Поэтому DAE, в отличие от AE, обладает способностью восстанавливать исходный вход из зашумленного входного сигнала.
Чтобы изучить высокоуровневое представление данных, в [208] предложена комбинация многослойных AE с максимальной дробовой компонентой, которая уменьшает спектральную размерность HSI, в то время как классификатор логистической регрессии softmax используется для HSIC. В исследовании, сообщённом в [209], объединена многообразия многообразий, предложенная в [210], с противодействующим автокодировщиком [211] для улучшения неконтролируемой HSIC. Работа [212] совместно использует спектрально-пространственные признаки HSI через неконтролируемый фреймворк извлечения признаков, состоящий из сети рекурсивных автокодировщиков (RAE). Он извлекает признаки из окрестности целевого пикселя, и веса назначаются на основе спектрального сходства между целевым и соседними пикселями. Двухпоточная DNN со схемой слияния по классам была введена в [213], которая адаптивно изучает веса слияния. Один поток, состоящий из стекированного шумоподавляющего автокодировщика, используется для извлечения спектральных признаков, а второй поток реализован для извлечения пространственной информации с использованием свёрточной нейронной сети (CNN), в то время как окончательная классификация выполняется путём слияния оценок классов, полученных из результатов классификации обоих потоков.
Другая работа предложила гибридную архитектуру для многопризнаковой спектрально-пространственной HSIC, которая использует метод главных компонент (PCA) для снижения размерности, управляемые фильтры [214] для получения пространственной информации и разреженный AE для извлечения признаков высокого уровня. Фреймворк, предложенный в [215], использовал как спектральную, так и пространственную информацию для HSIC, применяя пакетное обучение AE, а признаки генерируются путём объединения спектральной и пространственной информации с помощью схемы среднего пулинга. Другая работа [216] разработала спектрально-пространственный HSIC-фреймворк путём извлечения соответствующего пространственного разрешения HSI и использования стекированного разреженного AE для извлечения признаков высокого уровня с последующим случайным лесом (RF) для окончательной классификации.
Аналогично, [217] также использовал стекированный разреженный AE для различных типов представлений, таких как спектрально-пространственные и мультифрактальные признаки, наряду с другими статистическими представлениями высшего порядка. Комбинация SAE и экстремального машинного обучения была предложена в [218] для HSIC, которая сегментирует признаки обучающего набора и преобразует их через SAE; после преобразования подмножества признаков перестраиваются в соответствии с исходным порядком обучающего набора и подаются в классификаторы на основе ELM, а для окончательного результата классификации используется Q-статистика. Такая обработка подмножеств признаков помогает улучшить дисперсию между базовыми классификаторами [218]. Аналогично, в недавней работе [219] реализован вычислительно эффективный AE на основе многослойного ELM, который изучает признаки в три этапа, как предложено в [220] для HSIC.
Чтобы преодолеть проблему высокой внутриклассовой изменчивости и высокого межклассового сходства в HSI, [221] разработали HSIC на основе стекированного автокодировщика (SAE), который может изучать компактные и дискриминационные признаки путём введения регуляризации локального дискриминанта Фишера. Аналогично, в последней работе [222] k-разреженный шумоподавляющий AE соединён со спектрально-ограниченными пространственными признаками, которые преодолевают высокую внутриклассовую изменчивость пространственных признаков для HSIC. В исследовании [223] предложена HSIC-архитектура, которая сначала создаёт спектральные сегменты HSI на основе меры взаимной информации для уменьшения времени вычислений во время извлечения признаков через SAE, в то время как пространственная информация включается с использованием расширенных морфологических профилей (EMPs), а для окончательной классификации используется SVM/RF. Недавно [224] использовали SAE для классификации нефтяных пятен на поверхности моря, совместно используя спектрально-пространственные признаки HSI.
A. Будущие направления для AE-основанной HSIC
В предыдущем разделе мы рассмотрели последние разработки методов на основе AE для HSIC. Хотя такие фреймворки обеспечивают мощную прогностическую производительность и демонстрируют хорошую обобщающую способность, всё ещё требуются более сложные работы. Многие из обсуждаемых подходов не полностью используют богатую пространственную информацию, поэтому необходимы дальнейшие методы, которые могут полностью использовать совместную пространственную и спектральную информацию для HSIC. Кроме того, проблема высокой внутриклассовой изменчивости и высокого межклассового сходства в HSI также препятствует производительности классификации. Многие из вышеперечисленных работ решили эту проблему, но требуются дальнейшие исследования для преодоления вышеупомянутой проблемы. Одним из направлений может быть дальнейшее изучение таких подходов, как предварительное обучение, совместное обучение и адаптивные нейронные сети и т.д. для AE-основанных HSIC-фреймворков.
VIII. ГЛУБОКИЕ СЕТИ ДОВЕРИЯ (DBN)
Глубокая сеть доверия (DBN) [225] – это иерархическая глубокая DNN, которая изучает признаки из входных данных неконтролируемым, послойным образом. Слои в DBN строятся с использованием ограниченной машины Больцмана (RBM), состоящей из двухслойной архитектуры, в которой видимые блоки соединены со скрытыми блоками [226], как показано на Рисунке 9.
Подробный обзор RBM можно найти в [226]. Чтобы извлечь более полные признаки из входных данных, скрытый блок одной RBM может быть подан на видимые блоки другой RBM. Такой тип послойной архитектуры строит DBN, которая обучается жадно и может извлекать глубокие признаки из HSI. Архитектура трёхслойной DBN показана на Рисунке 10.
В литературе несколько работ реализовали DBN для целей HSIC. Например, [227] использовали DBN для классификации земельного покрова путём объединения спектрально-пространственной информации и провели сравнение с некоторыми другими подходами к классификации. Обычный процесс обучения DBN включает два этапа: первый – неконтролируемое предварительное обучение с неразмеченными выборками, второй – контролируемая точная настройка с помощью размеченных выборок. Однако этот процесс обучения может привести к двум проблемам: во-первых, несколько скрытых блоков могут иметь тенденцию реагировать одинаково [228] из-за совместной адаптации [229]; во-вторых, это связано с разреженностью и избирательностью активирующих нейронов – некоторые нейроны могут всегда быть «мёртвыми» или всегда реагирующими [230]. Чтобы смягчить эти две проблемы, [231] ввели диверсифицированную DBN-модель путём регуляризации процессов предварительного обучения и точной настройки с помощью наложения априорного ограничения на разнообразие для повышения точности классификации DBN для HSI.
Чтобы извлечь эффективные текстурные признаки для HSIC, работа [232] предложила фреймворк улучшения текстурных признаков на основе DBN, который объединяет группировку каналов и подход выбора образцов каналов с управляемым фильтром для улучшения текстурных признаков, которые затем изучаются моделью DBN, а окончательные результаты классификации получаются с помощью классификатора softmax. Работа [233] реализовала фреймворк с параллельными слоями, состоящий из RBM Гаусса-Бернулли, которая извлекает высокоуровневые, локально инвариантные и нелинейные признаки из HSI, а для классификации используется слой логистической регрессии.
Чтобы повысить точность классификации, некоторые работы рассматривают совместное использование спектральной и пространственной информации, содержащейся в HSI. Например, [234] представили DBN-фреймворк со слоем логистической регрессии и подтвердили, что совместное использование спектрально-пространственных признаков приводит к повышению точности классификации. Аналогично, [235] предложили спектрально-пространственный графовый метод RBM для HSIC, который строит спектрально-пространственный граф через совместную меру сходства на основе спектральных и пространственных деталей, затем RBM обучается для извлечения полезных совместных спектрально-пространственных признаков из HSI, и наконец, эти признаки подаются в DBN и слой логистической регрессии для классификации.
A. Будущие направления для DBN-основанной HSIC
В предыдущем разделе мы рассмотрели последние разработки фреймворков HSIC на основе DBN. Мы заметили, что по сравнению с другими DNN, очень мало работ использовали DBN для целей HSIC. Поэтому необходимо дальнейшее исследование устойчивых методов на основе DBN, которые могут совместно использовать пространственные и спектральные признаки для HSIC. Кроме того, другим направлением исследований может быть регуляризация процессов предварительного обучения и точной настройки DBN для эффективного преодоления проблемы «мёртвых» или потенциально сверхчувствительных (всегда реагирующих) нейронов.
IX. РЕКУРРЕНТНАЯ НЕЙРОННАЯ СЕТЬ (RNN)
Архитектура рекуррентной нейронной сети (RNN) (показана на Рисунке 11) содержит циклические соединения, где активация узла на следующем шаге зависит от предыдущего шага [236]. Поэтому RNN способны изучать временные последовательности. RNN-модели обрабатывают спектральную информацию данных HSI как временную последовательность, рассматривая спектральные каналы как временные шаги [237]. Существует три основные модели RNN: a) обычная (Vanilla), b) долгая краткосрочная память (LSTM) и c) управляемый рекуррентный блок (GRU).
Vanilla – это самая простая RNN-модель, которая приводит к деградации информации при обработке высокоразмерных данных. Модели LSTM, состоящие из двух состояний, преодолевают эту проблему, управляя потоком информации через три затвора: входной, забывания и выходной. Они изучают релевантную информацию с течением времени, отбрасывая постороннюю информацию. Однако стратегия управления затворами делает LSTM значительно сложным подходом. Вариант GRU для LSTM обладает простотой модели Vanilla и обеспечивает высокую производительность, аналогичную LSTM. GRU – это более простая версия LSTM, которая модифицирует входной и забывающий затворы в обновляющий (zt)(zt​) и сбрасывающий (rt)(rt​) затворы и удаляет выходной затвор. Сравнение внутренней архитектуры LSTM и GRU представлено на Рисунке 12.
Работа [59] предложила фреймворк HSIC на основе RNN с новой функцией активации (параметрический выпрямленный tanh) и GRU, который использует последовательное свойство HSI для определения меток классов. В [130] был представлен фреймворк RNN на основе метода локальных пространственных последовательностей (LSS), который сначала извлекает низкоуровневые признаки из HSI с использованием фильтра Габора и дифференциальных морфологических профилей [131], а затем объединяет эти признаки для получения LSS-признаков из предложенного метода; эти LSS-признаки далее подаются в RNN-модель для извлечения высокоуровневых признаков, в то время как слой softmax используется для окончательной классификации.
Учитывая полезность пространственной информации для достижения более высокой точности классификации, работа [238] предложила сеть на основе спектрально-пространственной LSTM, которая изучает спектральные и пространственные признаки HSI с использованием двух отдельных LSTM с последующим слоем softmax для классификации, в то время как стратегия слияния решений реализована для получения совместных спектрально-пространственных результатов классификации. Аналогично, [239] предложили RNN на основе патчей с ячейками LSTM, которая включает мультивременную и мультиспектральную информацию вместе с пространственными характеристиками для классификации земельного покрова.
В литературе несколько работ предложили гибридные архитектуры RNN на основе свёрточной нейронной сети (CRNN) для HSIC. Например, [163] реализовали свёрточную RNN, в которой первые несколько CONV-слоёв используются для извлечения позиционно-инвариантных признаков среднего уровня, а затем рекуррентные слои используются для извлечения спектрально-контекстных деталей для HSIC. Аналогично, [240] использовали такую модель для полуавтоматической HSIC с использованием псевдометок. Исследование [241] предложило фреймворк HSIC, в котором CNN используется для извлечения пространственных признаков из HSI, затем эти признаки подаются в сеть слияния на основе GRU, которая выполняет слияние на уровне признаков и на уровне решений.
Аналогично, Ло и др. [242] использовали как спектральную, так и пространственную информацию, содержащуюся в HSI, путём объединения CNN с параллельной RNN на основе GRU, что упрощает обучение GRU и улучшает производительность. Двунаправленная свёрточная LSTM (CLSTM) была предложена в [141] для совместного использования спектрально-пространственных признаков HSI для классификации. В [243] объединены многомасштабные локальные спектрально-пространственные признаки, извлечённые с помощью 3D-CNN, с иерархической RNN, которая изучает пространственные зависимости локальных спектрально-пространственных признаков на нескольких масштабах. Рекуррентная 2D-CNN и рекуррентная 3D-CNN для HSIC были предложены в [244] вместе с интересным сравнением этих фреймворков с соответствующими 2D- и 3D-CNN-моделями, что подтверждает превосходство рекуррентных CNN. Работа [245] объединила CNN с CLSTM, в которой 3D-CNN-модель используется для захвата низкоуровневых спектрально-пространственных признаков, а CLSTM рекуррентно анализирует эту низкоуровневую спектрально-пространственную информацию. Недавно [59] ввели каскадную RNN для HSIC, которая состоит из двух слоёв RNN на основе GRU: первый слой используется для уменьшения избыточных спектральных каналов, а второй слой – для изучения признаков из HSI; кроме того, несколько свёрточных слоёв используются для включения богатой пространственной информации, содержащейся в HSI.
A. Будущие направления для RNN-основанной HSIC
В предыдущем разделе мы рассмотрели последние разработки методов на основе RNN для HSIC. Хотя фреймворки HSIC на основе RNN привлекли значительное внимание сообщества дистанционного зондирования и достигли большого успеха с точки зрения производительности классификации, остаётся много аспектов, требующих дальнейшего исследования. Например, построение последовательных входных данных для RNN. Большинство рассмотренных методов рассматривают пиксель HSI как последовательную точку, т.е. пиксель из каждого спектрального канала образует последовательность данных. Однако это значительно увеличивает длину входной последовательности RNN, что может привести к проблеме переобучения.
Кроме того, обработка таких больших последовательностей данных увеличивает вычислительное время, и процесс обучения становится медленнее. Поэтому необходимо дальнейшее изучение использования инструментов параллельной обработки для достижения хорошей обобщающей способности RNN-основанной HSIC. Кроме того, такие подходы, как группировка спектральных каналов для уменьшения длины последовательности данных и использование всей спектральной сигнатуры для лучшего различения различных классов, могут быть дополнительно исследованы для построения последовательного входа RNN-модели. Ещё одним интересным будущим направлением может быть реализация RNN-фреймворков HSIC в реальном мультивременном контексте HSI.
X. СТРАТЕГИИ ДЛЯ ОГРАНИЧЕННЫХ РАЗМЕЧЕННЫХ ВЫБОРОК
Хотя DNN успешно используются для задачи HSIC, они требуют значительно большого количества размеченных обучающих данных. Однако, как обсуждалось ранее, сбор размеченных HSI очень трудоёмок и дорог из-за множества факторов, требующих либо экспертов-людей, либо исследования сценариев реального времени. Ограниченная доступность размеченных обучающих данных препятствует производительности классификации. Для преодоления вышеупомянутой проблемы в литературе было предложено множество эффективных стратегий. В этом разделе мы кратко обсудим некоторые из этих стратегий, сосредоточившись на алгоритмах активного обучения.
A. Аугментация данных
Чтобы бороться с проблемой ограниченных обучающих выборок, аугментация данных является эффективным инструментом для HSIC. Она генерирует новые выборки из исходных обучающих выборок без дополнительных затрат на разметку. Подходы к аугментации данных можно разделить на две основные стратегии: i) обёртывание данных; ii) передискретизация [246]. Обёртывание данных обычно кодирует различные инвариантности (перенос, размер, ракурс и/или освещение) путём проведения геометрических и цветовых преобразований с сохранением меток, а методы аугментации на основе передискретизации увеличивают обучающие данные, генерируя синтетические выборки на основе исходных распределений данных. Методы передискретизации включают генерацию экземпляров на основе смесей, аугментацию в пространстве признаков [246] и генеративно-состязательные сети (GAN) [247].
Что касается литературы по HSIC, несколько фреймворков на основе аугментации данных были использованы для улучшения производительности классификации путём предотвращения потенциального переобучения, которое обычно вызывается ограниченной доступностью обучающих данных. Например, [248] увеличили обучающие данные, используя три операции аугментации (отражение, поворот и перенос), а затем эти увеличенные данные были использованы для обучения CNN для HSIC. Работа [249] представила всестороннее сравнение различных широко используемых методов аугментации данных HSI и предложила аугментацию данных на основе пар пиксельных блоков, которая использовала как спектральную, так и пространственную информацию HSI для синтеза новых экземпляров для обучения CNN-модели для HSIC. Работа [250] сравнила производительность классификации комбинации CNN и AL с аугментацией данных и без неё и продемонстрировала, что аугментация данных приводит к более высокой точности классификации. Аналогично, в другом сравнении [251] CNN на основе аугментации данных показала увеличение точности HSIC на 10%10% по сравнению с CNN на основе PCA.
Вышеупомянутые методы используют автономные методы аугментации данных, которые увеличивают обучающие данные путём создания новых экземпляров во время/перед процессом обучения модели. Недавно в [252] был предложен новый фреймворк аугментации данных для HSI, который, вместо увеличения обучающих данных, генерирует выборки во время тестирования, а DNN, обученная на исходных обучающих данных, вместе со схемой голосования используется для окончательной метки класса. Чтобы улучшить обобщающую способность DNN-моделей, работа [252] также предложила две быстрые техники аугментации данных для высококачественной синкретизации данных. Аналогичная стратегия аугментации данных в реальном времени на основе PCA предложена в [253], которая также синтезирует новые экземпляры во время вывода, а не обучения.
B. Полуавтоматическое/неконтролируемое обучение
Подходы полуавтоматического обучения (SSL) изучают распределение данных, совместно используя как размеченные, так и неразмеченные данные. Эти методы расширяют обучающие данные, используя неразмеченные выборки вместе с размеченными для построения связи между пространством признаков и метками классов. В литературе было предложено несколько SSL-фреймворков для HSIC, которые можно разделить на следующие категории: i) совместное обучение (co-training), ii) самообучение (self-training), iii) генеративно-состязательные сети (GAN), iv) графовые SSL-модели и v) полуавтоматический SVM. Недавний всесторонний обзор этих SSL-методов можно найти в [254]. Кроме того, ещё один углублённый обзор SSL-подходов представлен в [255].
SSL-методы для HSIC кратко обобщены в [256], где авторы также сделали подробное сравнение этих методов. Метод, представленный в [240], использовал псевдометки или кластерные метки для предварительного обучения CRNN для HSIC, а небольшое количество размеченных данных используется для точной настройки сети. Аналогично, [144] предложили полуавтоматический HSIC-фреймворк, который использует PCA и расширенные морфологические атрибутные профили для извлечения псевдоразмеченных выборок, которые подаются в сеть глубокого слияния признаков на основе CNN.
Работа [257] предложила двухстратегический подход совместного обучения на основе спектральных и пространственных признаков HSI. Аналогично, [258] отдельно предварительно обучили два SAE: один с использованием спектральных, а другой – пространственных признаков HSI, а точная настройка достигается с помощью подхода совместного обучения. [259] предложили подход самообучения на основе информации о регионах для улучшения обучающих данных. Графовый фреймворк самообучения был разработан в [260], где начальная выборка достигается с помощью субтрактивной кластеризации. Недавно [145] улучшили производительность HSIC, присваивая псевдометки неразмеченным выборкам через механизм самообучения на основе кластеризации и регулируя самообучение с помощью пространственных ограничений.
C. Генеративно-состязательная сеть (GAN)
Генеративно-состязательная сеть (GAN), предложенная [261], состоит из двух нейронных сетей: одна называется генератором, а другая – дискриминатором (Рисунок 13). GAN могут научиться воспроизводить выборки, используя детали распределения данных. Работа [262] предложила GAN на основе спектральных признаков для SSL-основанной HSIC.
Аналогично, [263] предложили GAN-фреймворк для спектрально-пространственной HSIC. Аналогично, [264] разработали CNN-основанные 1D1D-GAN и 3D3D-GAN архитектуры для повышения производительности классификации. 1D-специализированная GAN используется для генерации спектральных признаков [265], которые затем используются CNN для извлечения признаков, а затем выполняется голосование большинством для HSIC. Совсем недавно [266] ввели пространственно-спектральную многоклассовую GAN (MSGAN), которая использует два генератора для создания пространственной и спектральной информации с помощью нескольких состязательных целей. Чтобы решить проблему дисбаланса данных для классификации HSI, [267] предложили новую полуавтоматическую модель, которая объединяет GAN с условными случайными полями (CRF).
Аналогично, [268] исследовали модель Caps-TripleGAN, которая эффективно генерирует новые выборки, используя 1D1D-структуру тройной генеративно-состязательной сети (TripleGAN), и классифицирует сгенерированные образцы HSI с помощью капсульной сети (CapsNet). Работа [269] предложила использовать сеть генератора на основе 3D3D CNN и сеть дискриминатора на основе 3D3D глубокой остаточной сети для HSIC. Чтобы изучить высокоуровневые контекстные признаки, в [270] предложена комбинация капсульной сети и дискриминационной модели на основе свёрточной долгой краткосрочной памяти (ConvLSTM) для HSIC.
<center>Рис. 13: Общая архитектура генеративно-состязательной сети (GAN).</center>
Работа [271] решает проблему нехватки обучающих примеров, используя GAN-модель, где производительность дискриминатора дополнительно улучшается вспомогательным классификатором для создания более структурно согласованных виртуальных обучающих выборок. Кроме того, для повышения производительности модели [272] предложили технику на основе генеративного состязательного передискретизации меньшинств для решения давней проблемы дисбаланса данных по классам, присущей HSIC.
D. Перенос обучения
Перенос обучения улучшает производительность модели, используя предварительные знания релевантной основной задачи для выполнения вторичной задачи. Другими словами, информация, извлечённая из релевантного исходного домена, переносится в целевой домен для изучения неизвестных/неразмеченных данных. Поэтому перенос обучения может быть эффективно применён в областях с недостаточными или отсутствующими обучающими данными. Основываясь на доступности размеченных обучающих экземпляров, фреймворки переноса обучения могут быть дополнительно классифицированы как контролируемый или неконтролируемый перенос обучения. Обычно предполагается, что исходный и целевой домены связаны, но не точно одинаковы. Однако они могут следовать разным распределениям, как в случае HSIC, где категории интереса одинаковы, но данные в двух доменах могут различаться из-за различных условий получения.
В HSIC на основе DNN модель изучает признаки иерархическим образом, где нижние слои обычно извлекают общие признаки при обучении на различных изображениях. Поэтому признаки, изученные этими слоями, могут быть перенесены для обучения нового классификатора для целевого набора данных. Например, [273] предварительно обучили двухканальную спектрально-пространственную CNN-модель с большим количеством обучающих данных из других HSI, а затем применили нижние слои предварительно обученной модели к целевой сети для устойчивой классификации целевого HSI. Чтобы изучить специфические для цели признаки, более высокие слои целевой сети инициализируются случайным образом, и вся сеть дообучается с использованием ограниченного количества размеченных экземпляров целевого HSI. Аналогично, [274] предложили подходящий метод для предварительного обучения и дообучения CNN-сети для использования её для классификации новых HSI. Исследование [275] объединило аугментацию данных и подходы переноса обучения для борьбы с нехваткой обучающих данных с целью улучшения производительности HSIC.
Как обсуждалось ранее, данные в исходном и целевом доменах могут различаться во многих аспектах, например, в случае HSI размеры двух HSI могут различаться из-за получения от разных сенсоров. Обработка таких кросс-доменных вариаций и перенос знаний между ними известен как гетерогенный перенос обучения (подробный обзор таких методов можно найти в [276]). В литературе по HSIC было предложено несколько работ для преодоления разрыва при переносе знаний между двумя HSI с различными размерами и/или распределениями.
Например, [277] предложили эффективный фреймворк HSIC на основе гетерогенного переноса обучения, который хорошо работает как с однородными, так и с гетерогенными HSI, а [278] использовали итеративный механизм перевзвешивания на основе гетерогенного переноса обучения для HSIC. Аналогично, недавняя работа [279] предложила подход переноса обучения на основе выбора каналов для предварительного обучения CNN, который сохраняет одинаковое количество размерностей для различных HSI. Кроме того, [280] предложили неконтролируемую технику переноса обучения для классификации полностью неизвестного целевого HSI, а [281] продемонстрировали, что сети, обученные на естественных изображениях, могут улучшить производительность переноса обучения для классификации данных дистанционного зондирования по сравнению с сетями, обученными с нуля на меньших данных HSI.
E. Активное обучение
Активное обучение (AL) итеративно повышает прогностическую производительность классификатора путём активного увеличения размера обучающих данных на каждой итерации обучения с использованием пула неразмеченных выборок. На каждой итерации AL увеличивает обучающий набор данных, активно выбирая наиболее ценные экземпляры из пула неразмеченных данных, а оракул (человек или машина) назначает истинные метки классов этим экземплярам. Наконец, эти полезные экземпляры добавляются к существующему обучающему набору данных, и классификатор переобучается на этом новом обучающем наборе данных. Процесс продолжается до тех пор, пока не будет достигнут критерий остановки, который может быть размером обучающего набора данных, количеством итераций или желаемой точностью. Общая схема AL показана на Рисунке 14.
Отбор наиболее полезных/эффективных выборок производится таким образом, чтобы выборки были информативными и репрезентативными для общего входного распределения для повышения точности. Основываясь на критериях добавления новых экземпляров в обучающий набор, AL-фреймворки могут быть потоковыми или пуловыми. При потоковом отборе один экземпляр за раз извлекается из фактического набора неразмеченных выборок, и модель решает, нужно ли его размечать на основе его полезности. В то время как при пуловой стратегии выборки запрашиваются из пула/подмножества неразмеченных данных на основе ранговых оценок, вычисленных по различным мерам для оценки полезности выборки.
Работа [282] показала, что потоковый отбор даёт более низкую скорость обучения по сравнению с пуловым, так как первый имеет тенденцию запрашивать лишние экземпляры. При пуловом отборе важно включать разнообразие в пул выборок, чтобы избежать избыточности в пуле выборок. Как правило, при выборе/запросе наиболее ценных выборок уделяется внимание следующим трём аспектам: гетерогенность, производительность модели и репрезентативность выборок. Краткое введение в эти подходы к выборке дано ниже:
  1. Выбор на основе гетерогенности: Эти подходы выбирают выборки, которые более гетерогенны по отношению к уже виденным экземплярам с точки зрения разнообразия модели, неопределённости классификации и противоречия между комитетом различных классификаторов. Выборка по неопределённости, ожидаемое изменение модели и запрос комитетом являются примерами моделей на основе гетерогенности.
  • Выборка по неопределённости: В этом подходе классификатор итеративно пытается запросить метку тех выборок, для которых он наиболее неопределёнен при предсказании метки. Отбор новых экземпляров основан на ранговых оценках относительно заданного порога, и экземпляры с оценками, ближайшими к этому порогу, запрашиваются для меток. Простым примером такой схемы может быть реализация вероятностного классификатора на выборке в сценарии бинарной классификации и запрос её метки, если предсказанная вероятность класса близка к 0.5.
  • Запрос комитетом: Такие подходы на основе гетерогенности выполняют процесс выборки на основе различий в предсказаниях различных классификаторов, обученных на одном и том же наборе размеченных выборок. Комитет различных классификаторов, обученных на одном и том же обучающем наборе данных, используется для предсказания меток классов неразмеченных выборок, и выборки, для которых классификаторы расходятся больше, выбираются для запроса меток. Комитет различных классификаторов может быть построен с использованием алгоритмов ансамблевого обучения, таких как Bagging и Boosting [283], или путём изменения параметров модели [284]. Обычно меньшего количества разнообразных классификаторов достаточно для построения комитета [283], [285].
  • Ожидаемое изменение модели: Такой подход на основе гетерогенности выбирает экземпляры, которые приводят к значительному изменению текущей модели с точки зрения градиента целевой функции. Такие методы пытаются запросить метку для тех экземпляров, которые значительно отличаются от текущей модели. Эти методы выборки подходят только для моделей, которые следуют процедурам обучения/оптимизации на основе градиента.
  1. Выбор на основе производительности: Такие методы учитывают влияние добавления запрошенных выборок на производительность модели. Они пытаются оптимизировать производительность модели путём уменьшения дисперсии и ошибки. Существует два типа выборки на основе производительности:
  • Ожидаемое уменьшение ошибки: Этот подход взаимосвязан с выборкой по неопределённости таким образом, что меры неопределённости максимизируют неопределённость метки выборки, которую нужно запросить, в то время как ожидаемое уменьшение ошибки уменьшает неопределённость метки запрошенной выборки. Ссылаясь на уже обсуждаемый пример бинарной классификации, подход ожидаемого уменьшения ошибки выбрал бы выборки с вероятностью, далёкой от 0.5, чтобы уменьшить частоту ошибок. Такие методы также известны как модели наибольшей определённости [284].
  • Ожидаемое уменьшение дисперсии: Уменьшение дисперсии модели гарантирует уменьшение будущей ошибки обобщения [286]. Поэтому методы ожидаемого уменьшения дисперсии пытаются косвенно уменьшить ошибку обобщения путём минимизации дисперсии модели. Такие подходы запрашивают экземпляры, которые приводят к наименьшей дисперсии модели. Информационное отношение Фишера является хорошо известным фреймворком минимизации дисперсии.
  1. Выбор на основе репрезентативности: Модели на основе гетерогенности склонны включать выбросы и спорные выборки, но подходы на основе производительности неявно избегают таких выборок, оценивая будущие ошибки. Репрезентативная выборка стремится запрашивать такие экземпляры, которые являются репрезентативными для общего входного распределения, поэтому избегает выбросов и нерепрезентативных выборок. Эти подходы придают больший вес плотным входным областям в процессе запроса. Методы с взвешиванием по плотности, такие как информационная плотность, являются примерами подходов к репрезентативной выборке, которые учитывают репрезентативность выборок наряду с гетерогенностью и также известны как гибридные модели [284].
Недавно AL интенсивно использовался в HSIC. [287] предложили управляемый признаками AL-фреймворк для определения хорошо структурированного пространства признаков для HSIC. [288] предложили полуавтоматический метод AL на основе случайного леса, который использует спектрально-пространственные признаки для определения функции запроса для выбора наиболее информативных выборок в качестве целевых кандидатов для обучающего набора.
Пространственная информация интенсивно использовалась во многих AL-основанных HSIC. Например, [289] представили AL-фреймворк, который объединяет спектральные и пространственные признаки суперпикселей. Аналогично, [290] использовали информацию об окрестности и суперпикселях для повышения неопределённости запрошенных выборок. В недавней работе [291] использовали атрибутные профили для включения пространственной информации в AL-фреймворк HSIC.
Пакетные AL-фреймворки широко использовались для ускорения процесса обучения. Такие подходы выбирают пакет выборок на каждой итерации для запроса метки. Поэтому разнообразие выборок крайне важно в пакетных AL-методах для избежания избыточности. Многокритериальный пакетный AL-метод, предложенный [292], определяет новую функцию запроса на основе мер разнообразия, неопределённости и кластерного предположения. Эти критерии определяются с использованием свойств KNN, SVM и K-средних соответственно, и наконец, генетические алгоритмы используются для выбора пакета наиболее эффективных выборок. Аналогично, [293] предложили регуляризованный мультиметрический пакетный AL-фреймворк для HSIC, который использует различные признаки HSIC.
Мультивью-фреймворк AL (MVAL) был предложен в [294], который анализирует объект с различных точек зрения и измеряет информативность выборки через мультивью-критерии запроса на основе интенсивности. Аналогично, [295] также использовали концепцию мультивью-обучения с использованием дискриминантного отношения Фишера для генерации нескольких представлений. В другой работе [296] предложили новый адаптивный MVAL-фреймворк для HSIC, который совместно использует пространственные и спектральные признаки в каждом представлении. Недавно [297] предложили MVAL-метод, использующий детали на уровне пикселей, субпикселей и суперпикселей для генерации нескольких представлений для HSIC. Кроме того, предложенный метод использует совместную оценку апостериорной вероятности и различия между несколькими представлениями для запроса репрезентативных выборок.
В литературе по HSIC несколько работ объединили AL и DNN. Например, [298] объединили автокодировщик с AL-методом, а [299] предложили AL-фреймворк на основе DBN для HSIC. Аналогично, [300] объединили байесовскую CNN с парадигмой AL для спектрально-пространственной HSIC. Недавно [250] предложили AL-фреймворк на основе CNN для лучшего использования неразмеченных выборок для HSIC.
Многие работы интегрировали AL с переносом обучения для HSIC. Например, [301] предложили AL-фреймворк переноса обучения, который извлекает значимые выборки и использует высокоуровневые признаки для корреляции данных исходного и целевого доменов. Другая работа [302] предложила технику активного переноса обучения на основе стекированного разреженного AE, которая совместно использует как спектральные, так и пространственные признаки для HSIC. Другая работа [303] объединила методы адаптации доменов и AL на основе нескольких ядер для HSIC.
AL-основанная HSIC предлагает несколько сложных фреймворков для улучшения обобщающей способности моделей. Например, [25] предложили AL-метод на основе нечёткости для улучшения обобщающей производительности дискриминативных и генеративных классификаторов. Метод вычисляет расстояние на основе нечёткости каждого экземпляра и оценённой границы класса, и экземпляры с большими значениями нечёткости и меньшими расстояниями от границ классов выбираются в качестве кандидатов для обучающего набора. Недавно [304] предложили нерандомизированный спектрально-пространственный AL-фреймворк для многоклассовой HSIC, который объединяет подход нечёткости с пространственным априором с мультиномиальной логистической регрессией через классификатор с разделением и дополненным лагранжианом. Авторы также сделали всестороннее сравнение предложенного фреймворка с современными методами выбора выборок вместе с различными классификаторами.
XI. ЭКСПЕРИМЕНТАЛЬНАЯ ОЦЕНКА
Большинство ориентированных на исследования работ, опубликованных в литературе, представляют всестороннюю экспериментальную оценку для выявления плюсов и минусов предложенной работы. Однако в некоторой степени эти работы могут иметь разные экспериментальные настройки, например, обучающие, валидационные и тестовые выборки могут иметь одинаковое количество или процентное соотношение, но выборки могут быть разными, так как они обычно выбираются случайным образом. Поэтому для справедливого сравнения различных работ, предложенных в литературе, необходимо иметь одинаковые экспериментальные настройки.
Эти экспериментальные настройки включают одинаковые выборки (географические местоположения должны оставаться одинаковыми для всех выбранных моделей, а не разными) и количество выборок, которое должно быть выбрано для каждого раунда обучения в процессе перекрёстной проверки. Обычно эти выборки выбираются случайным образом, поэтому вполне вероятно, что они могут быть разными для разных моделей, если модели выполняются в разное время.
Другая проблема с большинством литературы, предложенной в последние годы, – это перекрытие между обучающими/тестовыми выборками, т.е. обучающие/валидационные выборки выбираются случайным образом (включая или исключая вышеуказанный пункт) для обучения и валидации, однако весь набор данных подаётся на этапе тестирования, что приводит к сильно смещённой модели (так как обучающие выборки уже были видны модели) и даёт высокую точность. Таким образом, в этой работе обучающие/тестовые выборки хотя и выбраны случайным образом (потому что все модели выполнялись одновременно), однако вышеуказанный пункт был принят во внимание, и пересечение между этими выборками остаётся пустым.
A. Экспериментальные наборы данных
Набор данных Indian Pines (IP) был собран с помощью спектрометра Airborne Visible/Infrared Imaging Spectrometer (AVIRIS) [305] над тестовым участком Indian Pines в северо-западной части Индианы. Он содержит 224 спектральных канала в диапазоне длин волн от 400 до 2500нм2500нм. 24 нулевых и искажённых канала были удалены. Пространственный размер изображения – 145×145145×145 пикселей, и оно состоит из 16 взаимоисключающих классов растительности. Пространственное разрешение – 20 метров на пиксель (м/п). Детальное описание классов и карты эталонных данных представлены на Рисунке 15a. Кроме того, карты непересекающихся обучающих/тестовых выборок представлены на Рисунках 15b и 15c.
Набор данных Kennedy Space Center (KSC) был собран в 1996 году с помощью AVIRIS [305] с длинами волн от 400 до 2500нм2500нм. Изображение имеет 512×614512×614 пикселей и 176 спектральных каналов после удаления некоторых каналов с низким отношением сигнал/шум (SNR). Набор данных KSC содержит 5202 размеченных образца, всего 13 классов возвышенностей и водно-болотных угодий. Детальное описание классов и карты эталонных данных представлены на Рисунке 16a. Кроме того, карты непересекающихся обучающих/тестовых выборок представлены на Рисунках 16b и 16c.
Набор данных University of Pavia (UP) был получен с помощью сенсора Reflective Optics System Imaging Spectrometer (ROSIS) во время полёта над университетским кампусом в Павии, Северная Италия [306]. Он состоит из 610×340610×340 пикселей с 103 спектральными каналами в диапазоне длин волн от 430 до 860нм860нм и разрешением 2.5 м/п. Он содержит 9 классов городского земельного покрова. Детальное описание классов и карты эталонных данных представлены на Рисунке 17a. Кроме того, карты непересекающихся обучающих/тестовых выборок представлены на Рисунках 17b и 17c.
Набор данных University of Houston (UH), опубликованный IEEE Geoscience and Remote Sensing Society, был собран с помощью компактного авиационного спектрографа (CASI) в 2013 году [307] в рамках конкурса по слиянию данных.
Он состоит из 340×1905340×1905 пикселей с 144 спектральными каналами. Пространственное разрешение этого набора данных – 2.5м/п2.5м/п с длиной волны от 0.38 до 1.05μм1.05μм. Наконец, эталонные данные содержат 15 различных классов земельного покрова. Детальное описание классов и карты эталонных данных представлены на Рисунке 18a, а карты непересекающихся обучающих/тестовых выборок – на Рисунках 18b и 18c.
Таблица I предоставляет краткое описание каждого набора данных, используемого в следующих экспериментах, тогда как Таблица II перечисляет количество непересекающихся выборок (т.е. обучающие/тестовые выборки, выбранные из каждого класса), использованных для всех экспериментальных результатов. Обратите внимание, что количество обучающих/тестовых выборок (т.е. процентное соотношение) и географические местоположения обучающих/тестовых выборок остаются одинаковыми для всех экспериментальных методов (конкурирующих методов).
B. Экспериментальные результаты
Чтобы подкрепить идеи, выдвинутые в этом обзоре, и сделать утверждения обоснованными, основные вклады, сделанные в последние годы, включают MLR, SVM, MLP, RNN, LSTM, GRU, CNN-1D, CNN-2D, CNN-3D и MorphCNN. Некоторые из репрезентативных работ для каждого из вышеперечисленных: Облачная реализация логистической регрессии для HSIC [308] (MLR), Классификация гиперспектральных изображений дистанционного зондирования с помощью SVM [309] (SVM), Глубокие рекуррентные нейронные сети для HSIC [59] (RNN), Долгая краткосрочная память [311] (LSTM), О свойствах нейронного машинного перевода: подходы кодировщик-декодер [312] (GRU), Глубокие свёрточные нейронные сети для HSIC [313] (CNN1D), Глубокое обучение с учителем для классификации гиперспектральных данных через свёрточные нейронные сети [314] (CNN2D), 3-D подход глубокого обучения для классификации изображений дистанционного зондирования [315] (CNN3D), Морфологические свёрточные нейронные сети для HSIC [183] (MorphCNN) и MLP [310].
В некоторой степени все вышеупомянутые работы основаны на свёрточных и рекуррентных сетях и оцениваются на четырёх эталонных гиперспектральных наборах данных, а именно Indian Pines (IP), Pavia University (PU), Kennedy Space Center (KSC) и Houston Scene. Этот обзор уделяет внимание только устойчивости всех этих моделей при малом размере обучающих данных для классификации HSI с учётом совместной пространственно-спектральной классификации.
Здесь мы перечислили экспериментальные результаты с подробным обсуждением полученных результатов. Полученные точности для непересекающихся обучающих и тестовых выборок показаны в Таблицах III, IV, V и VI и на Рисунках 19, 20, 21 и 22. Все результаты, показанные в таблицах и на рисунках, получены с использованием 10-кратной перекрёстной проверки для вычисления общей, средней и каппа (κ)(κ) точности для целей сравнения. Например, рассмотрим случай набора данных Pavia University. Для этого конкретного случая работа [183] имеет самую высокую среднюю, общую и каппа (κ)(κ) точности, которые составляют 95.51%95.51%, 93.95%93.95% и 93.95%93.95% соответственно по сравнению со средними, общими и каппа (κ)(κ) точностями для других сравнительных работ: 92.55%92.55%, 89.94%89.94%, 89.9%89.9% для [314]; 89.43%89.43%, 86.25%86.25%, 85.61%85.61% для [315]; 89.09%89.09%, 89.5%89.5%, 85.5%85.5% для [313]; 82.05%82.05%, 87.43%87.43%, 76.89%76.89% для [310]; 80.38%80.38%, 83.63%83.63%, 74.76%74.76% для [312]; 80.38%80.38%, 84.06%84.06%, 74.32%74.32% для [311]; 77.8%77.8%, 86.12%86.12%, 72.06%72.06% для [309]; 77.07%77.07%, 83.83%83.83%, 70.84%70.84% для [59]; и 72.23%72.23%, 82.12%82.12%, 65.44%65.44% для [308]. Аналогичные наблюдения можно сделать и для других экспериментальных наборов данных.
Сравнительные методы в основном неправильно классифицируют выборки со сходными пространственными структурами (например, классы лугов и голой почвы для набора данных Pavia University), как показано в таблице и на рисунке. Кроме того, общая точность для класса «необученный виноград» ниже, чем для других классов по вышеупомянутым причинам. Вкратце, можно сказать, что более высокая точность может быть достигнута путём увеличения количества размеченных обучающих выборок. Таким образом, большее количество размеченных обучающих выборок может дать лучшие точности для всех конкурирующих методов.
В целом, работы [183], [314] превзошли (т.е. показали стабильные результаты) другие сравнительные методы, особенно в случае меньшего количества размеченных обучающих выборок. Вышеизложенное позволяет сделать вывод, что эти работы не чувствительны к количеству обучающих выборок. Более того, с увеличением количества обучающих выборок точности для этих методов также увеличиваются, однако другие методы могут работать лучше с большим количеством обучающих выборок по сравнению с этими методами. Аналогичная тенденция наблюдалась и при большем количестве обучающих выборок. Таким образом, можно сделать вывод, что работы [183] и [314] могут в некоторой степени решить проблему ограниченной доступности обучающих выборок при рассмотрении непересекающихся обучающих/тестовых выборок.
Кроме того, можно сделать вывод, что модели на основе AE не работают так же хорошо, как другие модели, хотя неконтролируемые методы не требуют разметки выборок; если нет ограничений, эти методы могут не изучить ничего. Кроме того, AE имеет симметричную архитектуру, что приводит к дискриминационной границе решений для HSIC. TL эффективно использует сходство между различными HSI для уменьшения необходимого количества для обучения, а также уменьшает количество обучаемых параметров, повышая устойчивость моделей. В соответствии с исходными данными (т.е. обработка HSI без извлечения/обучения признаков) DA генерирует больше выборок, что вносит разнообразие выборок.
XII. ЗАКЛЮЧЕНИЕ И БУДУЩИЕ НАПРАВЛЕНИЯ

Богатая информация, содержащаяся в данных HSI, является привлекательным фактором, обусловливающим использование технологии HSI в реальных приложениях. Более того, достижения в методах машинного обучения усиливают потенциал применения таких технологий. В этой работе мы рассмотрели последние разработки в области классификации гиперспектральных изображений (HSIC) с использованием современных глубоких нейронных сетей (например, автокодировщик (AE), глубокая сеть доверия (DBN), рекуррентная нейронная сеть (RNN), свёрточная нейронная сеть (CNN), перенос обучения (TL), обучение с малым числом примеров (FSL), активное/самообучение (AL/SL) и аугментация данных (DA)) в различных схемах обучения (в частности, с учителем, полуавтоматическом и без учителя). Кроме того, мы проанализировали стратегии преодоления проблем ограниченной доступности обучающих данных, такие как аугментация данных, обучение с малым числом примеров (FSL), перенос обучения и активное обучение и т.д. В соответствии с обсуждаемыми методологиями мы выбрали некоторые репрезентативные работы для проведения экспериментов на эталонных наборах данных HSI.

Хотя современные методы HSIC отражают быстрое и замечательное совершенствование задачи, дальнейшие разработки всё ещё необходимы для улучшения обобщающих способностей. Основной проблемой HSIC на основе глубоких нейронных сетей является нехватка размеченных данных. Данные HSI печально известны ограниченной доступностью размеченных данных, а глубокие нейронные сети требуют достаточно большого количества размеченных обучающих данных. В разделе X обсуждались некоторые широко используемые стратегии для борьбы с вышеупомянутой проблемой, но значительные улучшения всё ещё необходимы для эффективного использования ограниченных доступных обучающих данных. Одним из направлений решения этой проблемы может быть исследование интеграции различных стратегий обучения, обсуждаемых в разделе X, чтобы получить совместные преимущества. Ещё один способ – использовать подходы обучения с малым числом примеров или K-примеров, которые могут точно предсказывать метки классов только с несколькими размеченными выборками. Кроме того, необходимо сосредоточиться на совместном использовании спектрально-пространственных признаков HSI для дополнения точности классификации, достигаемой вышеупомянутыми HSIC-фреймворками. Ещё одним будущим потенциалом HSIC является вычислительно эффективная архитектура. Поэтому проблема высокой вычислительной сложности глубоких нейронных сетей имеет первостепенное значение, и крайне важно реализовать параллельные HSIC-архитектуры для ускорения обработки глубоких нейронных сетей, чтобы соответствовать вычислительным требованиям критических по времени HSI-приложений. В этом направлении могут быть использованы высокопроизводительные вычислительные платформы и специализированные аппаратные модули, такие как графические процессоры (GPU) и программируемые вентильные матрицы (FPGA), для реализации параллельных HSIC-фреймворков.

Таким образом, для создания нового HSIC-фреймворка, учитывающего вышеупомянутые аспекты, необходимо надлежащим образом использовать ограниченные обучающие выборки, рассматривая совместные спектрально-пространственные признаки HSI и сохраняя низкую вычислительную нагрузку.

БЛАГОДАРНОСТИ

Авторы благодарят Ганесана Нараянасами, который возглавляет направление IBM OpenPOWER/POWER по обеспечению и экосистеме по всему миру, за его поддержку в получении доступа к системе IBM AC922.

СПИСОК ЛИТЕРАТУРЫ

[1] M. Ahmad, A. Khan, A. M. Khan, M. Mazzara, S. Distefano, A. Sohaib, and O. Nibouche, "Spatial prior fuzziness pool-based interactive classification of hyperspectral images," Remote Sensing, vol. 11, no. 9, May. 2019.

[2] D. Hong, W. He, N. Yokoya, J. Yao, L. Gao, L. Zhang, J. Chanussot, and X. X. Zhu, "Interpretable hyperspectral artificial intelligence: When non-convex modeling meets hyperspectral remote sensing," IEEE Geosci. Remote Sens. Mag., vol. 9, no. 2, pp. 52–87, 2021.

[3] "10 Important Applications of hyperspectral image." https://grindgis.com/remote-sensing/10-important-applications-of-hyperspectral-image. Accessed: 2020-03-10.

[4] F. Xing, H. Yao, Y. Liu, X. Dai, R. L. Brown, and D. Bhatnagar, "Recent developments and applications of hyperspectral imaging for rapid detection of mycotoxins and mycotoxigenic fungi in food products," Critical Reviews in Food Science and Nutrition, vol. 59, no. 1, pp. 173–180, 2019. PMID: 28846441.

[5] "Applications of hyperspectral image." https://resonon.com/applications. Accessed: 2020-03-10.

[6] M. Ahmad, A. M. Khan, and R. Hussain, "Graph-based spatial spectral feature learning for hyperspectral image classification," IET Image Processing, vol. 11, no. 12, pp. 1310–1316, 2017.

[7] J. M. Haut, M. E. Paoletti, J. Plaza, and A. Plaza, "Fast dimensionality reduction and classification of hyperspectral images with extreme learning machines," Journal of Real-Time Image Processing, vol. 15, no. 3, pp. 439–462, 2018.

[8] D. Hong, N. Yokoya, J. Chanussot, J. Xu, and X. Zhu, "Learning to propagate labels on graphs: An iterative multitask regression framework for semi-supervised hyperspectral dimensionality reduction," ISPRS J. Photogramm. Remote Sens., vol. 158, pp. 35–49, 2019.

[9] M. Ahmad, S. Lee, D. Ulhaq, and Q. Mushtaq, "Hyperspectral remote sensing: Dimensional reduction and end member extraction," International Journal of Soft Computing and Engineering (IJSCE), vol. 2, pp. 2231–2307, 05 2012.

[10] D. Hong, N. Yokoya, J. Chanussot, J. Xu, and X. X. Zhu, "Joint and progressive subspace analysis (jpsa) with spatial-spectral manifold alignment for semi-supervised hyperspectral dimensionality reduction," IEEE Trans. Cybern., vol. 51, no. 7, pp. 3602–3615, 2021.

[11] J. M. Bioucas-Dias, A. Plaza, N. Dobigeon, M. Parente, Q. Du, P. Gader, and J. Chanussot, "Hyperspectral unmixing overview: Geometrical, statistical, and sparse regression-based approaches," IEEE journal of selected topics in applied earth observations and remote sensing, vol. 5, no. 2, pp. 354–379, 2012.

[12] M. Ahmad, A. Khan, and A. K. Bashir, "Metric similarity regularizer to enhance pixel similarity performance for hyperspectral unmixing," Optik - International Journal for Light and Electron Optics, vol. 140, pp. 86–95, July 2017.

[13] Y. Zhong, X. Wang, L. Zhao, R. Feng, L. Zhang, and Y. Xu, "Blind spectral unmixing based on sparse component analysis for hyperspectral remote sensing imagery," ISPRS Journal of Photogrammetry and Remote Sensing, vol. 119, pp. 49–63, 2016.

[14] M. Ahmad, D. Ihsan, and D. Ulhaq, "Linear unmixing and target detection of hyperspectral imagery using osp," in International Proceedings of Computer Science and Information Technology, pp. 179–183, 01 2011.

[15] M. Ahmad, D. Ulhaq, Q. Mushtaq, and M. Sohaib, "A new statistical approach for band clustering and band selection using k-means clustering," International Journal of Engineering and Technology, vol. 3, pp. 606–614, 12 2011.

[16] M. Ahmad, D. Ulhaq, and Q. Mushtaq, "Aik method for band clustering using statistics of correlation and dispersion matrix," in International Conference on Information Communication and Management, pp. 114–118, 01 2011.

[17] D. Hong, N. Yokoya, J. Chanussot, and X. Zhu, "An augmented linear mixing model to address spectral variability for hyperspectral unmixing," IEEE Trans. Image Process., vol. 28, no. 4, pp. 1923–1938, 2019.

[18] D. W. Stein, S. G. Beaven, L. E. Hoff, E. M. Winter, A. P. Schaum, and A. D. Stocker, "Anomaly detection from hyperspectral imagery," IEEE signal processing magazine, vol. 19, no. 1, pp. 58–69, 2002.

[19] S. Li, K. Zhang, Q. Hao, P. Duan, and X. Kang, "Hyperspectral anomaly detection with multiscale attribute and edge-preserving filters," IEEE Geoscience and Remote Sensing Letters, vol. 15, no. 10, pp. 1605–1609, 2018.

[20] X. Wu, D. Hong, J. Tian, J. Chanussot, W. Li, and R. Tao, "Orsim detector: A novel object detection framework in optical remote sensing imagery using spatial-frequency channel features," IEEE Trans. Geosci. Remote Sens., vol. 57, no. 7, pp. 5146–5158, 2019.

[21] X. Wu, D. Hong, J. Chanussot, Y. Xu, R. Tao, and Y. Wang, "Fourier-based rotation-invariant feature boosting: An efficient framework for geospatial object detection," IEEE Geosci. Remote Sens. Lett., vol. 17, no. 2, pp. 302–306, 2020.

[22] P. Chen, D. Hong, Z. Chen, X. Yang, B. Li, and B. Zhang, "Fccdn: Feature constraint network for vhr image change detection," arXiv preprint arXiv:2105.10860, 2021.

[23] M. Fauvel, Y. Tarabalka, J. A. Benediktsson, J. Chanussot, and J. C. Tilton, "Advances in spectral-spatial classification of hyperspectral images," Proceedings of the IEEE, vol. 101, no. 3, pp. 652–675, 2012.

[24] P. Ghamisi, J. Plaza, Y. Chen, J. Li, and A. J. Plaza, "Advanced spectral classifiers for hyperspectral images: A review," IEEE Geoscience and Remote Sensing Magazine, vol. 5, no. 1, pp. 8–32, 2017.

[25] M. Ahmad, S. Protasov, A. M. Khan, R. Hussain, A. M. Khattak, and W. A. Khan, "Fuzziness-based active learning framework to enhance hyperspectral image classification performance for discriminative and generative classifiers," PLoS ONE, vol. 13, p. e0188996, January 2018.

[26] M. Ahmad, S. Shabbir, D. Oliva, M. Mazzara, and S. Distefano, "Spatial-prior generalized fuzziness extreme learning machine autoencoder-based active learning for hyperspectral image classification," Optik-International Journal for Light and Electron Optics, 2020.

[27] M. Ahmad, A. M. Khan, R. Hussain, S. Protasov, F. Chow, and A. M. Khattak, "Unsupervised geometrical feature learning from hyperspectral data," in 2016 IEEE Symposium Series on Computational Intelligence (IEEE SSCI 2016), pp. 1–6, December 2016.

[28] M. Ahmad, S. Protasov, and A. M. Khan, "Hyperspectral band selection using unsupervised non-linear deep auto encoder to train external classifiers," CoRR, vol. abs/1705.06920, 2017.

[29] M. Ahmad, M. A. Alqarni, A. M. Khan, R. Hussain, M. Mazzara, and S. Distefano, "Segmented and non-segmented stacked denoising autoencoder for hyperspectral band reduction," Optik - International Journal for Light and Electron Optics, vol. 180, pp. 370–378, Oct 2018.

[30] D. Hong, N. Yokoya, J. Chanussot, and X. Zhu, "CoSpace: Common subspace learning from hyperspectral-multispectral correspondences," IEEE Trans. Geos. Remote Sens., vol. 57, no. 7, pp. 4349–4359, 2019.

[31] H. Zhang, W. He, L. Zhang, H. Shen, and Q. Yuan, "Hyperspectral image restoration using low-rank matrix recovery," IEEE Transactions on Geoscience and Remote Sensing, vol. 52, no. 8, pp. 4729–4743, 2013.

[32] W. Wei, L. Zhang, C. Tian, A. Plaza, and Y. Zhang, "Structured sparse coding-based hyperspectral imagery denoising with intracluster filtering," IEEE Transactions on Geoscience and Remote Sensing, vol. 55, no. 12, pp. 6860–6876, 2017.

[33] C. Yi, Y.-Q. Zhao, J. Yang, J. C.-W. Chan, and S. G. Kong, "Joint hyperspectral superresolution and unmixing with interactive feedback," IEEE Transactions on Geoscience and Remote Sensing, vol. 55, no. 7, pp. 3823–3834, 2017.

[34] C. Yi, Y.-Q. Zhao, and J. C.-W. Chan, "Hyperspectral image superresolution based on spatial and spectral correlation fusion," IEEE Transactions on Geoscience and Remote Sensing, vol. 56, no. 7, pp. 4165–4177, 2018.

[35] G. Cheng, J. Han, L. Guo, Z. Liu, S. Bu, and J. Ren, "Effective and efficient midlevel visual elements-oriented land-use classification using vhr remote sensing images," IEEE Transactions on Geoscience and Remote Sensing, vol. 53, no. 8, pp. 4238–4249, 2015.

[36] Q. Zhu, Y. Zhong, B. Zhao, G.-S. Xia, and L. Zhang, "Bag-of-visual-words scene classifier with local and global features for high spatial resolution remote sensing imagery," IEEE Geoscience and Remote Sensing Letters, vol. 13, no. 6, pp. 747–751, 2016.

[37] H. Wu, B. Liu, W. Su, W. Zhang, and J. Sun, "Hierarchical coding vectors for scene level land-use classification," Remote Sensing, vol. 8, no. 5, p. 436, 2016.

[38] G. Cheng, J. Han, and X. Lu, "Remote sensing image scene classification: Benchmark and state of the art," Proceedings of the IEEE, vol. 105, no. 10, pp. 1865–1883, 2017.

[39] D. Hong, N. Yokoya, N. Ge, J. Chanussot, and X. Zhu, "Learnable manifold alignment (LeMA): A semi-supervised cross-modality learning framework for land cover and land use classification," ISPRS J. Photogramm. Remote Sens., vol. 147, pp. 193–205, 2019.

[40] T. R. Martha, N. Kerle, C. J. van Westen, V. Jetten, and K. V. Kumar, "Segment optimization and data-driven thresholding for knowledge-based landslide detection by object-based image analysis," IEEE Transactions on Geoscience and Remote Sensing
09 сентября / 2026