23.09.2026 666 материалов

Нейросеть с 3281 параметром обыграла классическую модель на 8513 параметрах: что стоит за новым подходом к обработке сигналов

Исследователи сравнили два типа нейросетевых приёмников для цифровой связи и выяснили, что архитектура KAN воспроизводит ожидаемое поведение детектора с на 61,5% меньшим числом обучаемых параметров, чем классический MLP.

Нейросеть с 3281 параметром обыграла классическую модель на 8513 параметрах: что стоит за новым подходом к обработке сигналов

Нейросеть, которая экономит шесть из каждых десяти параметров и при этом не проигрывает в точности — это не маркетинговое обещание, а результат на простейшем тестовом стенде цифровой связи.


Зачем нейросетям заниматься тем, что уже решено?

Бинарная фазовая манипуляция (BPSK) по каналу с аддитивным белым гауссовым шумом — это учебный пример из первого семестра по теории связи. Оптимальный жёсткий детектор для этого случая известен десятилетия, формулы выписаны, всё работает. Зачем вообще городить нейросеть для задачи, у которой есть аналитическое решение?

Ответ на поверхности: никто не собирается заменять классический BPSK-детектор на нейросеть. Авторы исследования — Sude Ertan и соавторы — сознательно выбрали максимально простую и теоретически понятную задачу как полигон. Когда эталонное поведение детектора известно точно, можно честно измерить, насколько компактно та или иная нейросетевая архитектура способна его воспроизвести.

Это классический инженерный приём: сначала докажи метод на простом примере, потом масштабируй на сложные случаи.


MLP против KAN: два подхода к одной задаче

В центре сравнения — два типа нейронных сетей.

MLP (Multi-Layer Perceptron) — многослойный перцептрон, рабочая лошадка глубокого обучения. Каждый нейрон связан с каждым нейроном следующего слоя через обучаемые веса. Архитектура старая, проверенная, но не всегда компактная.

KAN (Kolmogorov-Arnold Network) — относительно свежая архитектура, вдохновлённая теоремой Колмогорова-Арнольда о представлении многомерных функций. Ключевое отличие: в KAN обучаемые функции сидят на рёбрах графа (то есть на связях между нейронами), а не в узлах. Это позволяет сети быть потенциально компактнее при сопоставимой выразительности.

Исследователи обучили обе архитектуры на синтетическом наборе данных BPSK с символьной частотой Найквиста при разных уровнях отношения сигнал/шум.


Цифры: на что смотреть

Главный результат — сведён в три метрики:

  • BER (Bit Error Rate) — вероятность ошибки на бит;
  • MSE (Mean Squared Error) — среднеквадратичная ошибка;
  • Количество обучаемых параметров — прокси-метрика для памяти, латентности и энергопотребления.
Архитектура Параметры Test BER
MLP 8 513 2,50 × 10⁻⁴
KAN 3 281 2,45 × 10⁻⁴

KAN достигает чуть лучшего BER с чуть большим, чем на 61% меньшим числом параметров. Обе модели корректно воспроизводят ожидаемую зависимость BER от отношения сигнал/шум — то есть не изобретают велосипед, а честно аппроксимируют известное поведение.


Почему это важно для реального железа

61% экономии параметров — не абстрактное число. В системах реального времени каждый параметр — это:

  • Память, которую нужно выделить под хранение весов;
  • Такты, которые процессор тратит на обращение к этим весам при инференсе;
  • Энергия, которая уходит на вычисления и доступ к памяти;
  • Кристалл, если речь об FPGA или ASIC, где каждый логический элемент на счету.

Для программно-определяемых радио (SDR), встраиваемых платформ и граничных (edge) устройств связи это не теория, а жёсткое ограничение. Классический MLP с 8,5 тысячи параметров — вполне уместный размер, но в мире микроконтроллеров с жёсткими лимитами SRAM и реального времени с жёсткими дедлайнами каждая сэкономленная тысяча параметров находит применение.


Скептицизм и оговорки

Перед тем как объявлять KAN новым стандартом, стоит учесть несколько моментов.

Во-первых, это препринт на arXiv (arXiv:2609.25847), а не рецензируемая публикация. Методология выглядит корректной, но результаты ещё не прошли формальную проверку сообщества.

Во-вторых, тестировалась одна из самых простых задач цифровой связи. BPSK по AWGN-каналу — это линейная детекция двух символов. В реальных системах каналы многолучевые, модуляции сложнее, интерференция агрессивнее. Как поведёт себя KAN в более сложных сценариях — вопрос открытый.

В-третьих, количество параметров — не единственная метрика эффективности. Важно ещё, как быстро выполняется инференс на конкретном чипе. KAN использует обучаемые функции на рёбрах — это могут быть сплайны или иные параметризованные аппроксимации. Если вычисление каждого такого сплайна дороже, чем одно умножение матриц в MLP, то экономия параметров может «съесться» на вычислительной стороне.


Контекст: KAN как архитектурный тренд

Архитектура KAN привлекла внимание исследовательского сообщества сравнительно недавно. Её ключевая идея — заменить фиксированные активационные функции в узлах на обучаемые функции на рёбрах — хорошо ложится на задачи, где нужна аппроксимация известных функций с минимальным числом параметров.

Обработка сигналов связи — естественная площадка для KAN, потому что многие операции в приёмнике (синхронизация, эквализация, демодуляция) хорошо описываются аналитически и потому могут быть компактно представлены подходящей архитектурой.


Итого: тест пройден, но марафон впереди

Исследование показывает, что на базовом стенде BPSK-AWGN архитектура KAN демонстрирует лучшую параметрическую эффективность, чем классический MLP. С 3281 параметром против 8513 — при сопоставимом BER — KAN выглядит экономичнее для сценариев, где ресурсы ограничены.

Это не революция, но значимый шаг для тех, кто проектирует нейросетевые приёмники связи для реального железа. Дальше — проверка на более сложных каналах, реальных сигналах и конкретных FPGA-платформах. Если KAN пройдёт и эти тесты, у классических перцептронов в обработке сигналов появится серьёзный конкурент.