Безопасность

Новая статья предупреждает, что финансовый ИИ можно манипулировать ниже выходного слоя

Новая статья на arXiv описывает невидимые каналы манипуляции в системах финансового консультирования с поддержкой ИИ, показывая, как выборка на этапе вывода может искажать рекомендации, при этом обходя проверки на основе вывода. Риск заключается не в плохом чат-боте; он заключается в финансовых советах, которые кажутся соответствующими требованиям, но тихо направляются в нужное русло.

Автор: Лео В ·

Новая статья предупреждает, что финансовый ИИ можно манипулировать ниже выходного слоя
Здание Нью-Йоркской фондовой биржи. Изображение: Wikimedia Commons.

Новый arXiv бумага на Финансовые консультации с поддержкой ИИ системы идентифицируют канал манипуляции, который находится ниже очевидного выходного слоя. Авторы утверждают, что противники могут исказить кредитные или инвестиционные мнения, сгенерированные моделью, на этап выборки сохраняя при этом вид обычного распределения выходных данных и проходя стандартные проверки черного ящика.

Это различие и есть история. Большинство подходов к управлению ИИ в финансах сосредоточено на том, что говорит система: является ли рекомендация справедливой, объяснимой, документированной или соответствующей правилам раскрытия информации. В этой статье утверждается, что сам процесс производства может быть манипулирован таким образом, чтобы результат выглядел статистически обычным, при этом подталкивая решения в желаемом направлении.

Манипуляция изначально тонкая

Авторы описывают атаку на стадии вывода, которая может усилить ключевые слова с направленным смещением примерно в 1,8–1,9 раза в кредитный рейтинг и сценарии инвестиционного консультирования. Еще более тревожно, что, как сообщается, манипулированные результаты не сработали ни на одном из шести детекторов "черного ящика" и сохранили целостность водяного знака в нескольких случаях watermarking schemes.

Здание Нью-Йоркской фондовой биржи символизирует ставки на целостность рынка в связи с финансовыми советами с помощью ИИ. Изображение: Mantis.
Здание Нью-Йоркской фондовой биржи символизирует ставки на целостность рынка в связи с финансовыми советами с помощью ИИ. Изображение: Mantis.

Техническое утверждение заключается в том, что аудит на основе результатов может потребовать непрактично больших выборок для обнаружения сдвига, потому что манипулируемое и нормальное распределения могут оставаться очень близкими. Простыми словами: система может выглядеть нормальной, если аудиторы не проверяют сам процесс вывода. Это серьёзная проблема для рынков, где небольшие изменения в рекомендациях могут повлиять на распределение ресурсов, доступ к кредитам или торговое поведение.

Почему финансы являются правильным предупреждающим примером

Финансовое консультирование является особенно чувствительной областью применения, поскольку стимулы уже имеют противоположный характер. Модель, которая оценивает кредит, суммирует риски или дает рекомендации portfolioМогут находиться между клиентами, учреждениями, посредниками и регуляторами. Если злоумышленник может управлять результатами, не нарушая поверхностное соответствие требованиям, ущерб может распределяться между многими решениями, вместо того чтобы проявляться в виде одного драматического инцидента.

Статья продвигает размышления о рисках ИИ в сторону безопасности на уровне инференции, а не только фильтрации подсказок или последующего обзора результатов. Изображение: Mantis / Лео В
Статья продвигает размышления о рисках ИИ в сторону безопасности на уровне инференции, а не только фильтрации подсказок или последующего обзора результатов. Изображение: Mantis / Лео В

Предлагаемые защиты также показательны. Авторы утверждают, что обычные программные генераторы псевдослучайных чисел недостаточны, а квантовая энтропия в сочетании с аппаратной изоляцией доверенных исполнительных сред блокировала атаку в их экспериментах. Это указывает на будущее, где для развертывания ИИ с высоким риском потребуется сертифицированная инфраструктура вывода, а не только одобренные модельные карты.

Регуляторам нужно провести аудит трубопровода

В статье предлагаются изменения в регулировании, касающиеся обязательной сертификации QRNG для высокорискованных финансовых ИИ-систем, аудитов цепочек поставок на уровне выводов и механизмов проверки происхождения результатов. Даже если регуляторы не примут именно эти предложения, направление ясно: проверка результатов слишком узкая, когда сам процесс вывода может стать поверхностью атаки.

Темы: безопасность ИИ, финансовое консультирование, выводы, целостность рынка

Канонический адрес статьи