Машинное забывание в GeoAI: умеют ли модели стирать память о месте?

Может ли искусственный интеллект забыть то, чему его научили? И если да, то как проверить, что он действительно забыл?
Парадокс цифровой памяти
Представьте: годы данных о перемещениях тысяч людей использованы для обучения модели мобильности. Она знает популярные маршруты, загруженные дороги, часто посещаемые районы. А затем один пользователь удаляет свою историю местоположений и требует, чтобы его информация больше не использовалась.
Удалить исходные записи из базы данных несложно. Но эти записи уже повлияли на модель в процессе обучения. Стирание данных не отменяет автоматически того, что модель успела изучить.
Возникает сложный вопрос: действительно ли информация исчезла, или же её влияние продолжает жить внутри нейросети?
Машинное забывание (machine unlearning) — это область исследований, которая пытается удалить вклад выбранных обучающих данных из уже существующей модели без её полной перестройки. Задача состоит в том, чтобы стереть требуемое влияние, сохранив при этом полезные знания, полученные из оставшихся данных.
Географическая информация делает эту задачу ещё сложнее, поскольку наблюдения связаны между собой через пространство и время. Путь одного человека также содержит информацию о загруженности дорог, времени в пути и активности в районе. Пространственно-временное забывание на графах показывает, что эта проблема только начинает изучаться в контексте динамических взаимосвязанных данных.
Удаление данных ≠ забывание
Убрать учебник со стола студента не означает стереть из его памяти то, что он уже из него выучил. Та же проблема возникает в машинном обучении. Удаление файла стирает его с диска, но обученная модель остаётся неизменной, поскольку её параметры уже были скорректированы под влиянием этих данных.
Самый надёжный, но и самый затратный способ — удалить выбранные записи и обучить модель заново на оставшихся данных. Это даёт модель, которая вообще никогда не видела удалённую информацию. Однако перестройка большой модели может потребовать огромного времени и вычислительных ресурсов.
Машинное забывание стремится избежать полного переобучения. Точные методы пытаются воспроизвести результат, который дала бы переобученная модель, а приближённые обновляют существующую модель более эффективно, принимая некоторое расхождение с эталонным результатом.
Некоторые системы изначально проектируются так, чтобы упростить последующее удаление. SISA-обучение разделяет обучающие данные на изолированные сегменты и обучает отдельные компоненты модели. Когда одну запись нужно удалить, переобучается только затронутый компонент, а не вся система. Это снижает вычислительные затраты, но географические данные создают дополнительную сложность: соседние наблюдения, повторяющиеся маршруты и связанные локации могут не разделяться на независимые группы.
Для GeoAI задача заключается не только в том, как обновить модель, но и в том, что именно относится к удаляемому запросу, а что должно остаться как географическое знание.
Почему географическую информацию трудно забыть
Географические данные сложно забывать, потому что пространственные наблюдения редко бывают независимыми. Один маршрут, снимок или запись сенсора обычно несут информацию о более широкой системе вокруг него.
Возьмём данные о мобильности. Траектория одного человека описывает не только его собственное передвижение. Она также даёт сигналы о дорожных связях, времени в пути, популярных перекрёстках и ритмах движения в районе. Если пользователь просит модель забыть его маршрут, система должна удалить именно этот специфический вклад, не стирая при этом структуру дорожной сети или общие паттерны передвижения, подтверждённые множеством других пользователей.
Та же проблема появляется в дистанционном зондировании. Ландшафты наблюдаются через перекрывающиеся фрагменты снимков, повторяющиеся проходы спутников и разные сенсоры. Удаление одного изображения не означает, что модель забыла это место, потому что соседние фрагменты часто содержат похожие структуры зданий, растительности и контекст землепользования.
Иными словами, географическое обучение пространственно связано: влияние одного образца часто выходит за его собственные границы.
Это делает геопространственное забывание более сложным, чем удаление записи о клиенте из базы данных. Модель могут попросить забыть координату, пользователя, маршрут, фрагмент снимка или даже целый регион. Это разные задачи, требующие разных уровней удаления. TraceHiding решает эту проблему в данных о мобильности, выделяя информацию о конкретной траектории пользователя, сохраняя при этом паттерны движения, общие для многих пользователей. CallosumNet расширяет проблему на пространственно-временные графы, где удаление выбранной информации не должно нарушать более широкую пространственную и временную структуру.
Что GeoAI может быть нужно забыть?
GeoAI может потребоваться забывать информацию по нескольким причинам.
Конфиденциальность — самая очевидная. Истории местоположений могут раскрывать дома, места работы, маршруты и посещения чувствительных мест. GDPR предусматривает право на забвение при определённых обстоятельствах, хотя удаление сохранённых записей автоматически не объясняет, как их влияние должно быть удалено из обученной модели.
Забывание может быть полезно, когда обучающие данные оказываются ненадёжными. Датасет может содержать неверные координаты, неправильно размеченные снимки, дублированные наблюдения, ошибки сенсоров или сфальсифицированную картографическую информацию. Удаление исходных файлов предотвращает будущее использование, но не отменяет их прежнего влияния на модель.
Права собственности на данные создают аналогичную проблему. Если поставщик данных отзывает датасет или меняет лицензию, разработчикам может понадобиться способ уменьшить его влияние без полной перестройки модели.
Регуляторные прецеденты показывают, почему это различие важно. В деле Everalbum Федеральная торговая комиссия США потребовала удаления лицевых эмбеддингов и моделей распознавания лиц, разработанных на основе определённых пользовательских данных. Урегулирование с WW International и Kurbo аналогично требовало уничтожения алгоритмов или других продуктов, созданных на основе незаконно собранных данных о детях. В этих случаях речь шла об удалении целых производных продуктов, а не о выборочном забывании отдельных образцов, но они показывают, что удаления сырых данных может быть недостаточно.
Для GeoAI будущие запросы могут касаться одного пользователя, маршрута, изображения, датасета или чувствительной локации. Надёжное удаление на каждом из этих уровней остаётся открытой технической проблемой.
Как узнать, что модель действительно забыла?
У успешного забывания две цели. Удалённая информация больше не должна влиять на модель, а полезные знания, полученные из оставшихся данных, должны сохраниться. Модель, которая забывает всё, удаляет целевую информацию, но становится бесполезной.
Самым надёжным эталоном обычно служит модель, переобученная с нуля без удалённых данных. Исследователи могут сравнить модель после забывания с этим «чистым» эталоном, чтобы увидеть, насколько похожи их прогнозы и поведение. Но одного совпадения по точности недостаточно.
Верификация машинного забывания различает поведенческие проверки (анализ выходов модели) и параметрические проверки (анализ изменений внутри модели). Тесты на принадлежность к выборке (membership inference) также могут проверить, может ли аудитор по-прежнему отличать забытые образцы от данных, которые никогда не использовались для обучения.
Забывание может создавать и новые риски для конфиденциальности. Unlearning inversion показывает, что различия между параметрами исходной и обновлённой модели могут содержать информацию, позволяющую восстановить данные, которые предполагалось забыть. UnlearnShield был предложен для снижения этого риска при сохранении точности модели и эффекта забывания.
GeoAI добавляет ещё один вопрос: что произошло вокруг удалённой информации? Если забыт маршрут одного пользователя, прогнозы для соседних дорог и районов не должны меняться без необходимости. Если удалён один спутниковый снимок, модель должна сохранять достоверные знания, подтверждённые перекрывающимися изображениями и соседними наблюдениями.
Идеальный результат удаляет требуемое влияние, оставляя остальную часть географической модели максимально неизменной. В GeoAI доказательства того, что одна запись забыта, может быть недостаточно. Нужно также понимать, что изменилось вокруг неё.
Проектируем модель GeoAI, умеющую ответственно забывать
Большинство систем ИИ проектируются для сохранения полезной информации. Будущим системам GeoAI, возможно, также потребуется предвидеть, что некоторые данные могут впоследствии потребовать удаления.
Первое требование — улучшенная прослеживаемость данных (data lineage). Разработчикам нужны чёткие записи о происхождении обучающих данных: какие географические области и периоды они охватывают, какие лицензии или разрешения применяются. Без этой информации может быть трудно определить, на какие части модели повлиял конкретный пользователь, датасет, сенсор или регион.
Второе требование — архитектура. Модели можно проектировать так, чтобы выбранные источники данных или компоненты можно было обновлять без перестройки всей системы. Однако географические данные не всегда можно разделить на независимые регионы, поскольку соседние локации часто связаны общими дорогами, экологическими паттернами и повторяющимися наблюдениями. Любое модульное решение должно сохранять эти пространственные связи.
Наконец, забывание должно проходить независимую проверку. Модель не должна просто заявлять, что информация удалена. Аудит доказательства незнания (proof-of-ignorance auditing) изучает, как можно отличить успешное забывание от неудачного, не прибегая каждый раз к полному переобучению в качестве эталона.
Вместо заключения
GeoAI в конечном счёте может потребоваться как постоянная память, так и контролируемое забывание. Память помогает моделям понимать, как меняются места и ландшафты. Забывание даёт способ удалять информацию, которая больше не должна на них влиять.
Задача заключается не только в том, чтобы заставить машины больше узнавать о Земле. Она в том, чтобы помочь им удалять то, что больше не должно запоминаться, сохранять то, что по-прежнему важно, и доказывать разницу между этими состояниями.
По материалам исследования «Machine Unlearning in GeoAI», Aravindh Subramanian, 2026
02 сентября / 2026