FLASH CLI: бесплатный ИИ-агент для терминала, который работает полностью локально
Новая утилита FLASH CLI позволяет запустить ИИ-ассистента прямо в терминале — без API-ключей, подписок и отправки данных в облако. Инструмент работает с локальными моделями через Ollama и умеет выполнять реальные команды.
FLASH CLI — это попытка дать разработчику ИИ-ассистента, который не отправляет ни байта данных на чужие серверы. Звучит идеалистично, но проект реально работает и уже доступен на GitHub.
Что такое FLASH CLI
FLASH (расшифровывается как Fast Local Agent SHell) — это консольная утилита с ИИ, которая подключается к локальному серверу Ollama и выполняет реальные действия в вашей системе: запускает команды, ищет в интернете, анализирует файлы. Всё это — без единого API-ключа и без подписки.
Идея простая: вместо того чтобы гонять запросы через ChatGPT или Claude и платить за каждый токен, вы ставите модель себе на машину через Ollama, а FLASH становится «обёрткой» с агентными способностями.
Чем отличается от обычных чат-ботов
Большинство терминальных ИИ-инструментов — это просто чат с подсветкой синтаксиса. FLASH утверждает, что он по-настоящему «агентный»: он планирует, выполняет и наблюдает результат, а не просто генерирует текст.
Вот что умеет FLASH из коробки:
- shell — запуск любых команд с таймаутом
- web_search — поиск через DuckDuckGo без внешних API
- get_os — определение операционной системы для корректных команд
- reason — промежуточные рассуждения (модель «думает вслух»)
Рабочий цикл выглядит так: FLASH получает задачу → планирует → выполняет команду → смотрит на результат → повторяет, пока задача не решена. Ответ выдаётся в Markdown с подсветкой кода.
Как это выглядит в деле
Запрос в терминале может выглядеть так:
[Flash]> what are the biggest files here?
Thinking: check the OS, then find the largest files
Retrieving operating system information
Executing shell command: du -ah . | sort -rh | head -3
Модель сама понимает, что сначала нужно узнать ОС, потом подобрать нужную команду. Это не просто «обёртка над генерацией текста» — здесь видна агентная логика.
При этом если ИИ не нужен, можно выполнить команду напрямую через префикс !:
[Flash]> !git status
On branch main
nothing to commit, working tree clean
Настройка и запуск
Конфигурация хранится в файле ~/.flash.env:
MODEL=llama3.1
OLLAMA_HOST=http://localhost:11434
Модель можно менять на лету командой /model. FLASH поддерживает любые модели с tool-функциями из Ollama — llama3.1, qwen2.5, mistral и другие. Достаточно указать имя модели в конфиге.
Если у вас есть выделенный GPU-сервер в локальной сети, FLASH подключится и к нему — нужно просто указать адрес в переменной OLLAMA_HOST.
Замечания и оговорки
Тут стоит остановиться и добавить ложку дёгтя.
Во-первых, статья на DEV.to написана самим разработчиком — это типичный промо-пост. Никаких независимых обзоров, бенчмарков или сравнений с аналогами (например, с Aider или aider-lite) автор не приводит.
Во-третьих, фраза из оригинальной статьи про «тихую загрузку вашего кода на чужие серверы» — это маркетинговый страх-приём. Да, облачные ИИ отправляют запросы в облако, но это не «тихая загрузка исходников», а явно задокументированный процесс. Не стоит воспринимать это как реальную угрозу для типичного проекта.
Во-четвёртых, работоспособность агента сильно зависит от качества модели. Мелкие модели (7B параметров) с трудом справляются с агентными задачами — они путают инструменты, генерируют невалидные команды, теряют контекст. FLASH здесь не волшебство, а обёртка, и результат зависит от «мозга» внутри.
Кому это может быть полезно
- Разработчикам, которые хотят ИИ-помощника в терминале, но не готовы отправлять код в облако
- Тем, у кого уже стоит Ollama и хочется к нему агентный интерфейс
- Энтузиастам приватности — всё остаётся на вашем железе
- Людям, которые просто хотят поэкспериментировать с локальными ИИ-агентами
Технические детали
FLASH написан на Python и поддерживает версии 3.10, 3.11 и 3.12. Тестировался на Linux, macOS и Windows. Код проверяется утилитами Ruff, Flake8 и Bandit — это плюс для open-source проекта.
Репозиторий: github.com/Natuworkguy/Flash
Вердикт
FLASH CLI — это интересный, но ранний проект. Концепция «всё локально, ничего не платишь» привлекательна, особенно для тех, кто уже крутит Ollama. Но реальная полезность будет зависеть от того, насколько хорошо модели справляются с агентным циклом — а это пока слабое место всей экосистемы локальных LLM.
Если у вас под рукой GPU и вы не боитесь экспериментов — стоит попробовать. Если ждёте готовое решение уровня GitHub Copilot — это пока не оно.