Поддельные ответы: Как обмануть системы анализа документов

Автор: Денис Аветисян


Новое исследование показывает, что системы, отвечающие на вопросы по документам, уязвимы к незаметным изменениям, которые могут привести к ложным ответам.

🚀 Квантовые новости

Подключайся к потоку квантовых мемов, теорий и откровений из параллельной вселенной.
Только сингулярные инсайты — никакой скуки.

Присоединиться к каналу
Исследование демонстрирует, что даже незначительные, намеренно внесённые искажения в структурированный текст документа, например, в счёт, могут привести к ошибочным ответам модели, способным повлечь за собой финансовые потери, несмотря на её корректную работу с исходным документом.
Исследование демонстрирует, что даже незначительные, намеренно внесённые искажения в структурированный текст документа, например, в счёт, могут привести к ошибочным ответам модели, способным повлечь за собой финансовые потери, несмотря на её корректную работу с исходным документом.

Исследователи продемонстрировали возможность проведения «end-to-end» атак на OCR-free системы Document Visual Question Answering с использованием визуально незаметных возмущений.

Несмотря на впечатляющий прогресс в области систем ответа на вопросы по документам (DocVQA), их устойчивость к злонамеренным воздействиям остаётся под вопросом. В работе «Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering» представлен новый сценарий атаки, направленный на незаметное изменение содержимого документов для манипулирования ответами моделей DocVQA, даже при использовании OCR-free архитектур. Показано, что разработанные алгоритмы позволяют создавать модифицированные документы, приводящие к предсказуемым, ошибочным ответам, что демонстрирует критические уязвимости существующих систем. Какие методы защиты необходимы для обеспечения надежности и безопасности DocVQA в реальных приложениях?


Уязвимость систем DocVQA: зависимость от OCR

Традиционные системы визуального вопросно-ответного анализа документов (DocVQA) в значительной степени зависят от оптического распознавания символов (OCR) для извлечения текстовой информации, что создает существенный риск возникновения ошибок. Процесс OCR преобразует изображение документа в машиночитаемый текст, и любые неточности на этом этапе — будь то неправильно распознанные символы, пропущенные слова или искаженные фрагменты — напрямую влияют на последующий анализ. Поскольку DocVQA системы используют извлеченный текст для ответа на вопросы о документе, ошибки OCR могут привести к неверным ответам и снижению общей надежности системы. Данная зависимость от OCR становится особенно критичной при работе со сканами низкого качества, рукописными документами или изображениями, содержащими сложные макеты и разнообразные шрифты, что делает этап распознавания текста узким местом в конвейере обработки документов.

Ошибки, возникающие на этапе оптического распознавания символов (OCR), оказывают каскадное влияние на всю систему обработки документов, существенно ограничивая точность и устойчивость моделей DocVQA. Даже незначительные погрешности в извлеченном тексте могут привести к неверной интерпретации вопроса и, как следствие, к ошибочному ответу. Поскольку DocVQA системы полагаются на корректно распознанный текст для понимания содержания документа, любая неточность в OCR становится критической точкой отказа, снижая способность модели к обобщению и корректной работе с документами различного качества и сложности. Это особенно заметно при обработке сканированных документов, содержащих шум, искажения или нестандартные шрифты, где ошибки OCR неизбежно накапливаются и приводят к существенному снижению производительности всей системы.

Зависимость систем понимания документов от оптического распознавания символов (OCR) создает ощутимое препятствие в производительности, особенно при работе с документами низкого качества или сложной компоновкой. Нечеткие изображения, искажения, неразборчивый почерк и сложные макеты значительно снижают точность OCR, что приводит к каскаду ошибок, распространяющихся по всей системе. В результате, даже самые совершенные модели анализа документов сталкиваются с трудностями при извлечении смысла из таких источников, поскольку ключевая информация может быть потеряна или искажена на начальном этапе обработки. Таким образом, низкое качество исходных данных становится узким местом, ограничивающим потенциал систем понимания документов и требующим разработки более устойчивых методов обработки.

Целенаправленная многовариантная атака, оптимизированная с использованием пяти вопросов в контексте всего документа, продемонстрирована на примере.
Целенаправленная многовариантная атака, оптимизированная с использованием пяти вопросов в контексте всего документа, продемонстрирована на примере.

DocVQA без OCR: новый подход к визуальному анализу

Методы, не требующие оптического распознавания символов (OCR), использующие возможности глубокого обучения, позволяют обучать модели DocVQA (Вопросы и ответы по документам) в сквозном режиме, минуя этап промежуточного извлечения текста. Традиционно, DocVQA системы сначала применяли OCR для преобразования изображения документа в текст, а затем использовали модели обработки естественного языка (NLP) для ответа на вопросы. В отличие от этого, OCR-free подходы обрабатывают изображение документа напрямую, позволяя модели изучать взаимосвязи между визуальными элементами и ответами на вопросы без необходимости предварительного преобразования в текст. Это достигается за счет использования архитектур глубокого обучения, способных извлекать релевантные признаки непосредственно из пикселей изображения, что повышает эффективность и точность модели, особенно при работе с документами низкого качества или сложной структурой.

Модели, такие как Pix2Struct и Donut, реализуют прямой анализ изображений документов, обходя этап оптического распознавания символов (OCR). Вместо извлечения текста, эти модели обучаются сопоставлять визуальные признаки документа с соответствующими ответами на заданные вопросы. Обучение происходит сквозным способом (end-to-end), где модель оптимизируется для непосредственного предсказания ответа, основываясь на пиксельных данных изображения документа. Это позволяет использовать информацию о форматировании, структуре и визуальном контексте документа, что может быть утеряно при традиционном подходе с OCR. Архитектуры этих моделей часто используют механизмы внимания и трансформеры для эффективной обработки визуальной информации и установления связей между различными элементами документа.

Использование методов, не требующих оптического распознавания символов (OCR), значительно повышает точность и устойчивость моделей DocVQA, особенно при работе со сложными типами документов. Традиционные системы, зависящие от OCR, подвержены ошибкам при обработке документов низкого качества, рукописного текста или документов со сложным макетом. Методы, напрямую обрабатывающие изображения документов, позволяют моделям учиться из визуальных признаков, минуя этап извлечения текста, что снижает вероятность ошибок и повышает надежность ответов на вопросы, касающиеся содержимого документа.

Результаты анализа отказов в ответах (DoA) показывают, что метрики ASR, CDMG и ANLS для моделей Pix2Struct и Donut изменяются в зависимости от количества оптимизированных пар вопросов-ответов (BB).
Результаты анализа отказов в ответах (DoA) показывают, что метрики ASR, CDMG и ANLS для моделей Pix2Struct и Donut изменяются в зависимости от количества оптимизированных пар вопросов-ответов (BB).

Угрозы для DocVQA без OCR: векторы атак

Несмотря на обход этапа оптического распознавания символов (OCR), модели DocVQA, работающие без OCR, остаются уязвимыми к атакам, основанным на использовании состязательных возмущений. Эти возмущения представляют собой незначительные, намеренно внесенные изменения в исходное изображение документа, которые, тем не менее, могут привести к ошибочным ответам модели. Суть атаки заключается не в прямой манипуляции с текстом, а в изменении визуального представления документа таким образом, чтобы модель неправильно интерпретировала его содержание. Эффективность таких атак демонстрирует, что визуальное понимание документов моделями DocVQA, даже без использования OCR, не является устойчивым к целенаправленным, хотя и едва заметным, манипуляциям с входными данными.

Четко сформулированная модель угроз является основой для анализа уязвимостей систем DocVQA, работающих без оптического распознавания символов (OCR). Такая модель определяет потенциальных злоумышленников, их цели, доступные ресурсы и возможные векторы атак. Она позволяет систематически выявлять слабые места в архитектуре системы, включая этапы предварительной обработки изображений, извлечения признаков и логического вывода. Без четкой модели угроз невозможно разработать эффективные механизмы защиты, а также оценить эффективность существующих контрмер. Определение параметров модели угроз, таких как тип атак (например, внесение возмущений в изображение, манипулирование метаданными) и допустимый уровень влияния на производительность системы, необходимо для разработки целенаправленных стратегий защиты и проведения реалистичных оценок безопасности.

Воздействие на этапы предварительной обработки изображений, в частности, на изменение размеров (resizing), может существенно снизить производительность систем DocVQA, работающих без оптического распознавания символов (OCR). Исследования показывают, что даже незначительные возмущения, вносимые в процесс изменения размеров изображения перед подачей на модель, приводят к заметному ухудшению точности ответов. Это связано с тем, что модели DocVQA, не использующие OCR, напрямую зависят от визуальных признаков, и любые изменения в их представлении, вызванные манипуляциями с размером изображения, могут привести к неверной интерпретации содержимого документа. В результате, преднамеренные возмущения на данном этапе представляют собой критическую уязвимость и потенциальный вектор атаки на системы DocVQA.

В отличие от традиционных атак, разрывающих вычислительный граф на этапе предварительной обработки, предложенный метод обеспечивает сквозную дифференцируемость, воссоздавая предварительную обработку для оптимизации атаки.
В отличие от традиционных атак, разрывающих вычислительный граф на этапе предварительной обработки, предложенный метод обеспечивает сквозную дифференцируемость, воссоздавая предварительную обработку для оптимизации атаки.

Экспериментальная оценка устойчивости DocVQA

Эксперименты, проведенные на наборе данных PFL-DocVQA с использованием алгоритма Projected Gradient Descent (PGD) для генерации возмущений, показали высокую уязвимость OCR-free DocVQA моделей. В определенных условиях, PGD позволял добиться почти 100%-ного успеха в манипулировании ответами путем внесения незаметных изменений во входные данные. Эти возмущения, будучи практически невидимыми для человека, оказывали существенное влияние на предсказанные ответы модели, демонстрируя ее чувствительность к небольшим, целенаправленным изменениям входного изображения.

Средняя нормализованная дистанция Левенштейна (ANLS) используется в качестве ключевой метрики для количественной оценки схожести между предсказанными и эталонными ответами при атаке. Эксперименты показали, что при атаках на нецелевые вопросы значение ANLS оставалось высоким, что указывает на незначительное влияние возмущений на качество предсказанных ответов. Высокое значение ANLS в данном контексте свидетельствует о том, что, несмотря на внесение возмущений в входные данные, модель продолжает генерировать ответы, семантически близкие к правильным, что позволяет оценить устойчивость системы к атакам, направленным на изменение ответа без конкретной цели.

Результаты экспериментов подчеркивают необходимость разработки улучшенных стратегий защиты от атак, направленных на системы DocVQA. В частности, модель Donut продемонстрировала практически нулевой процент успешных атак при попытке одновременного нарушения корректности ответов на несколько вопросов. Это указывает на повышенную устойчивость Donut к сложным, многокомпонентным adversarial perturbations, в отличие от других моделей, демонстрирующих высокую уязвимость при аналогичных атаках. Данный факт позволяет рассматривать архитектуру Donut как перспективную основу для создания более надежных систем обработки документов, способных противостоять целенаправленным манипуляциям.

Результаты целевых атак показывают, что метрики ASR, CDMG и ANLS для моделей Pix2Struct и Donut изменяются в зависимости от количества оптимизированных пар вопросов и ответов (BB).
Результаты целевых атак показывают, что метрики ASR, CDMG и ANLS для моделей Pix2Struct и Donut изменяются в зависимости от количества оптимизированных пар вопросов и ответов (BB).

Будущее Document AI: к истинной устойчивости

Современные исследования в области искусственного интеллекта, работающего с документами, часто направлены на создание специфических возмущений, адаптированных к каждому отдельному документу. Однако, представляется перспективным и одновременно сложным направлением поиск универсальных возмущений, способных эффективно нарушать работу систем распознавания и обработки документов вне зависимости от их содержания и структуры. Разработка таких универсальных стратегий атаки позволит не только выявить уязвимости существующих моделей, но и создать более надежные и устойчивые системы, способные противостоять широкому спектру манипуляций и ошибок в реальных условиях эксплуатации. Подобный подход требует углубленного изучения свойств пространства признаков документов и разработки алгоритмов, способных генерировать возмущения, сохраняющие визуальное сходство с оригиналом, но при этом приводящие к существенным ошибкам в работе системы.

Для разработки эффективных стратегий как атак, так и защиты в области искусственного интеллекта, обрабатывающего документы, необходима сквозная дифференцируемая схема. Такая схема позволяет вычислять градиенты потерь по отношению ко входным данным, что критически важно для создания целенаправленных возмущений — “атак”, выявляющих уязвимости системы. Более того, возможность обратного распространения ошибки через все этапы обработки документа — от распознавания текста до понимания его смысла — позволяет оптимизировать стратегии защиты, делая систему более устойчивой к подобным атакам. Именно сквозная дифференцируемость открывает путь к автоматизированному поиску и устранению слабых мест в моделях, обеспечивая более надежную и безопасную работу систем искусственного интеллекта в реальных условиях.

Преодоление обозначенных трудностей в области искусственного интеллекта для обработки документов откроет путь к созданию систем, способных надежно функционировать в реальных условиях. Повышение устойчивости к намеренным искажениям и непредсказуемым вариациям, встречающимся в повседневных документах, позволит автоматизировать задачи, требующие высокой точности, такие как обработка юридических документов, финансовых отчетов и медицинских записей. Разработка систем, способных адаптироваться к различным форматам, качеству сканирования и неполноте данных, станет ключевым фактором для широкого внедрения технологий искусственного интеллекта в различные отрасли, обеспечивая более эффективную и безошибочную обработку информации и снижая зависимость от ручного труда. В конечном итоге, это приведет к повышению производительности, снижению затрат и открытию новых возможностей для автоматизации сложных процессов.

Визуализация атаки демонстрирует, что незначительное изменение (ϵ = 96) в нижней правой части документа приводит к его модификации.
Визуализация атаки демонстрирует, что незначительное изменение (ϵ = 96) в нижней правой части документа приводит к его модификации.

Исследование показывает, что даже системы DocVQA, обходящиеся без оптического распознавания символов, уязвимы к едва заметным манипуляциям. Авторы демонстрируют, как тонкие искажения в изображении документа могут привести к ошибочным ответам. В этом нет ничего удивительного — каждая «революционная» технология завтра станет техдолгом. Как метко заметила Фэй-Фэй Ли: «Искусственный интеллект должен быть разработан таким образом, чтобы он служил человечеству, а не заменял его». В данном случае, уязвимость систем DocVQA напоминает о необходимости постоянного тестирования и совершенствования алгоритмов, чтобы избежать нежелательных последствий и обеспечить надёжность систем в реальных условиях. Продакшен всегда найдёт способ сломать элегантную теорию.

Что дальше?

Представленная работа, как и большинство, лишь аккуратно приподнимает краешек занавеса над бездной. Уязвимость систем DocVQA к незаметным искажениям, особенно в OCR-free архитектурах, предсказуема. Всегда находились умельцы, способные обмануть даже самую элегантную теорию. Вопрос не в том, что системы могут быть взломаны, а в том, как быстро и изящно это произойдет. И, конечно, сколько сил потребуется на исправление последствий.

Настоящий вызов — не в разработке более устойчивых моделей, а в признании их фундаментальной хрупкости. Автоматизация, обещающая спасение от рутины, неизбежно порождает новые, более изощренные способы поломки. Тесты — это, конечно, приятно, но они лишь форма надежды, а не гарантия. Следующим шагом, вероятно, станет поиск атак, которые не просто манипулируют ответами, а приводят к непредсказуемым, катастрофическим последствиям.

В конечном итоге, вся эта гонка за «робастностью» напоминает попытки укрепить карточный домик. Вместо того, чтобы строить неприступные крепости, возможно, стоит сосредоточиться на создании систем, способных быстро и элегантно восстанавливаться после неизбежных сбоев. Потому что, как показывает практика, скрипт, удаляющий прод, — это не исключение, а правило.


Оригинал статьи: https://arxiv.org/pdf/2512.04554.pdf

Связаться с автором: https://www.linkedin.com/in/avetisyan/

Смотрите также:

2025-12-06 06:15

Рекомендуем