Нейросеть с 3281 параметром обыграла классическую модель на 8513 параметрах: что стоит за новым подходом к обработке сигналов
Исследователи сравнили два типа нейросетевых приёмников для цифровой связи и выяснили, что архитектура KAN воспроизводит ожидаемое поведение детектора с на 61,5% меньшим числом обучаемых параметров, чем классический MLP.
Нейросеть, которая экономит шесть из каждых десяти параметров и при этом не проигрывает в точности — это не маркетинговое обещание, а результат на простейшем тестовом стенде цифровой связи.
Зачем нейросетям заниматься тем, что уже решено?
Бинарная фазовая манипуляция (BPSK) по каналу с аддитивным белым гауссовым шумом — это учебный пример из первого семестра по теории связи. Оптимальный жёсткий детектор для этого случая известен десятилетия, формулы выписаны, всё работает. Зачем вообще городить нейросеть для задачи, у которой есть аналитическое решение?
Ответ на поверхности: никто не собирается заменять классический BPSK-детектор на нейросеть. Авторы исследования — Sude Ertan и соавторы — сознательно выбрали максимально простую и теоретически понятную задачу как полигон. Когда эталонное поведение детектора известно точно, можно честно измерить, насколько компактно та или иная нейросетевая архитектура способна его воспроизвести.
Это классический инженерный приём: сначала докажи метод на простом примере, потом масштабируй на сложные случаи.
MLP против KAN: два подхода к одной задаче
В центре сравнения — два типа нейронных сетей.
MLP (Multi-Layer Perceptron) — многослойный перцептрон, рабочая лошадка глубокого обучения. Каждый нейрон связан с каждым нейроном следующего слоя через обучаемые веса. Архитектура старая, проверенная, но не всегда компактная.
KAN (Kolmogorov-Arnold Network) — относительно свежая архитектура, вдохновлённая теоремой Колмогорова-Арнольда о представлении многомерных функций. Ключевое отличие: в KAN обучаемые функции сидят на рёбрах графа (то есть на связях между нейронами), а не в узлах. Это позволяет сети быть потенциально компактнее при сопоставимой выразительности.
Исследователи обучили обе архитектуры на синтетическом наборе данных BPSK с символьной частотой Найквиста при разных уровнях отношения сигнал/шум.
Цифры: на что смотреть
Главный результат — сведён в три метрики:
- BER (Bit Error Rate) — вероятность ошибки на бит;
- MSE (Mean Squared Error) — среднеквадратичная ошибка;
- Количество обучаемых параметров — прокси-метрика для памяти, латентности и энергопотребления.
| Архитектура | Параметры | Test BER |
|---|---|---|
| MLP | 8 513 | 2,50 × 10⁻⁴ |
| KAN | 3 281 | 2,45 × 10⁻⁴ |
KAN достигает чуть лучшего BER с чуть большим, чем на 61% меньшим числом параметров. Обе модели корректно воспроизводят ожидаемую зависимость BER от отношения сигнал/шум — то есть не изобретают велосипед, а честно аппроксимируют известное поведение.
Почему это важно для реального железа
61% экономии параметров — не абстрактное число. В системах реального времени каждый параметр — это:
- Память, которую нужно выделить под хранение весов;
- Такты, которые процессор тратит на обращение к этим весам при инференсе;
- Энергия, которая уходит на вычисления и доступ к памяти;
- Кристалл, если речь об FPGA или ASIC, где каждый логический элемент на счету.
Для программно-определяемых радио (SDR), встраиваемых платформ и граничных (edge) устройств связи это не теория, а жёсткое ограничение. Классический MLP с 8,5 тысячи параметров — вполне уместный размер, но в мире микроконтроллеров с жёсткими лимитами SRAM и реального времени с жёсткими дедлайнами каждая сэкономленная тысяча параметров находит применение.
Скептицизм и оговорки
Перед тем как объявлять KAN новым стандартом, стоит учесть несколько моментов.
Во-первых, это препринт на arXiv (arXiv:2609.25847), а не рецензируемая публикация. Методология выглядит корректной, но результаты ещё не прошли формальную проверку сообщества.
Во-вторых, тестировалась одна из самых простых задач цифровой связи. BPSK по AWGN-каналу — это линейная детекция двух символов. В реальных системах каналы многолучевые, модуляции сложнее, интерференция агрессивнее. Как поведёт себя KAN в более сложных сценариях — вопрос открытый.
В-третьих, количество параметров — не единственная метрика эффективности. Важно ещё, как быстро выполняется инференс на конкретном чипе. KAN использует обучаемые функции на рёбрах — это могут быть сплайны или иные параметризованные аппроксимации. Если вычисление каждого такого сплайна дороже, чем одно умножение матриц в MLP, то экономия параметров может «съесться» на вычислительной стороне.
Контекст: KAN как архитектурный тренд
Архитектура KAN привлекла внимание исследовательского сообщества сравнительно недавно. Её ключевая идея — заменить фиксированные активационные функции в узлах на обучаемые функции на рёбрах — хорошо ложится на задачи, где нужна аппроксимация известных функций с минимальным числом параметров.
Обработка сигналов связи — естественная площадка для KAN, потому что многие операции в приёмнике (синхронизация, эквализация, демодуляция) хорошо описываются аналитически и потому могут быть компактно представлены подходящей архитектурой.
Итого: тест пройден, но марафон впереди
Исследование показывает, что на базовом стенде BPSK-AWGN архитектура KAN демонстрирует лучшую параметрическую эффективность, чем классический MLP. С 3281 параметром против 8513 — при сопоставимом BER — KAN выглядит экономичнее для сценариев, где ресурсы ограничены.
Это не революция, но значимый шаг для тех, кто проектирует нейросетевые приёмники связи для реального железа. Дальше — проверка на более сложных каналах, реальных сигналах и конкретных FPGA-платформах. Если KAN пройдёт и эти тесты, у классических перцептронов в обработке сигналов появится серьёзный конкурент.