Пароль на broker не заменяет авторизацию по topic. Общая учётная запись для всех устройств позволяет одному скомпрометированному клиенту подписаться на чужую телеметрию или публиковать команды всему парку. Публичный порт дополнительно привлекает автоматическое сканирование и подбор credentials.
Не проводите активный перебор на рабочем broker. Сначала сохраните конфигурацию и журналы, определите listeners, anonymous access, auth backend и ACL. Для проверки создайте два тестовых устройства разных владельцев и убедитесь, что каждое видит только свой namespace.
Что проверить в первую очередь
Для проблемы «MQTT-брокер открыт в интернет и не ограничивает publish и subscribe по topic» сначала зафиксируйте один воспроизводимый пример: точное время, идентификатор объекта, пользователя или операции, входные данные, версию приложения и фактический результат. Отдельно запишите ожидаемое поведение: доступ разрешён только аутентифицированным устройствам и сервисам, каждое identity имеет минимальный набор topics, соединение защищено TLS, а нарушения видны в аудите. Это не формальность. Без исходной точки легко принять временное совпадение за исправление, изменить сразу несколько условий и потерять возможность доказать настоящую причину сбоя.
Проверку начинайте с чтения состояния и журналов. Не запускайте массовый перерасчёт, повторную отправку, удаление записей или изменение прав на рабочей системе, пока не подготовлены резервная копия и способ отката. Секреты, токены, персональные данные и содержимое заказов в диагностические выгрузки не включайте.
- Проверьте публичные listeners, firewall, security groups и bind address.
- Убедитесь, что anonymous access отключён на каждом listener.
- Сверьте TLS-сертификат, версии протокола и обязательность проверки сервера клиентом.
- Найдите общие логины и встроенные в прошивки пароли.
- Просмотрите wildcard ACL, retained messages и системные topics.
Почему возникает проблема
Видимый симптом обычно находится в конце цепочки. Пользователь видит неверный статус или отказ, хотя первичная ошибка могла произойти в API, фоновой задаче, кеше, очереди, внешнем сервисе либо при проверке доступа. Основной риск этого сценария: посторонний клиент читает телеметрию, отправляет команды устройствам, перебирает topics или создаёт отказ в обслуживании. Поэтому исправление только интерфейса или ручная правка итоговой записи часто скрывает проблему, но не устраняет её.
Разбирайте события по хронологии и ищите первую точку, где фактические данные перестают соответствовать бизнес-правилу. В распределённой системе одинаково важны успешный ответ, повтор запроса, задержка события, параллельное выполнение и восстановление после временного отказа.
- Broker установлен с тестовой конфигурацией allow_anonymous.
- ACL разрешает # или tenant/+/command слишком широкому principal.
- Все устройства используют один логин из прошивки.
- Внутренний listener случайно опубликован через NAT или облачный firewall.
- Bridge и административный сервис работают с полными правами без отдельной identity.
Пошаговая диагностика
Создайте безопасный тестовый сценарий, максимально похожий на проблемный, но не затрагивающий реальные списания, рассылки и клиентские данные. Присвойте операции единый correlation ID и проследите его через входящий запрос, бизнес-логику, базу, очередь и внешние интеграции. Для каждого этапа фиксируйте вход, результат, код ответа, время выполнения и номер версии записи.
Сначала подтвердите сам факт расхождения, затем последовательно исключайте уровни. Сравните рабочий и ошибочный случаи по одним и тем же полям. Проверьте часовой пояс, формат идентификаторов, порядок событий, права сервисной учётной записи и актуальность конфигурации на каждом экземпляре приложения. Если результат зависит от повторного запроса, задержки или конкретного узла, это важная часть причины, а не случайный шум.
- Получите список listeners и фактических подключений по IP и client ID.
- Проверьте deny для подписки тестового tenant A на topic tenant B.
- Сопоставьте failed auth, ACL denied и необычные wildcard subscribe.
- Просмотрите retained команды и очистите только подтверждённо опасные записи.
- Проверьте duplicate client ID и неожиданные массовые reconnect.
Как изолировать устройства и topics
Каждое устройство или сервис получает отдельную identity. Namespace topic строится из доверенного tenant и device ID, а ACL формируется сервером, а не принимается из произвольного client ID.
Надёжная реализация хранит бизнес-состояние явно и не пытается восстановить его только по экрану, случайному логу или последнему webhook. У каждого значимого действия должен быть стабильный идентификатор, понятный владелец, версия правила и проверяемый переход статуса. Повторная доставка одного события не должна создавать второе действие, а запоздавшее событие не должно возвращать объект в невозможное состояние.
- Внешний listener использует TLS и строгую аутентификацию.
- Устройство публикует телеметрию только в свой topic и читает только собственные команды.
- Backend-компоненты имеют отдельные service account по функциям.
- Административный listener изолирован сетью и не доступен устройствам.
- Credentials можно отозвать и ротировать для одного устройства без остановки всего парка.
Как исправить проблему
Исправление разделите на небольшие обратимые изменения. Сначала устраните подтверждённую первопричину, затем восстановите повреждённые данные отдельной контролируемой процедурой. Не смешивайте выпуск нового кода и массовую коррекцию истории в одном непрозрачном запуске: для них нужны разные отчёты, критерии успеха и планы отката.
Если затронуты существующие записи, сначала сформируйте dry-run: список объектов, старое значение, предлагаемое новое значение и основание для изменения. Обновление должно быть идемпотентным, ограниченным точной выборкой и сопровождаться аудитом. Для финансовых данных, прав доступа и персональной информации предпочтительны компенсирующие записи, а не переписывание истории.
- Закройте лишние публичные listeners firewall и настройкой bind.
- Отключите anonymous и создайте уникальные credentials или клиентские сертификаты.
- Введите deny-by-default ACL с точными publish и subscribe patterns.
- Разделите bridge, backend и admin identities.
- Ротируйте общие секреты поэтапно и обновите устройства с контролем совместимости.
Безопасный порядок внедрения
- Сохраните конфигурацию, связанные записи и необходимые журналы; отдельно проверьте, что резервную копию действительно можно восстановить.
- Воспроизведите проблему на тестовом объекте и сохраните результат до изменения, чтобы после выпуска сравнить одинаковые сценарии.
- Внесите минимальное изменение под системой контроля версий, опишите причину, ожидаемый эффект, ограничения и точный способ отката.
- Прогоните нормальный сценарий, ошибочный ввод, повтор одного запроса, два параллельных запроса и временную недоступность зависимости.
- Выпустите изменение на ограниченную долю трафика или один процесс, если архитектура это позволяет, и сравните метрики со старой версией.
- Только после стабильного наблюдения выполните контролируемое исправление исторических данных и сохраните итоговый отчёт.
Как проверить результат
Один успешный пример недостаточен. Проверьте основную операцию повторно, крайние значения, одновременные действия, перезапуск процесса и восстановление после краткого сбоя сети. Результат подтверждайте не только экраном пользователя, но и состоянием базы, очереди, внешнего сервиса и журналом аудита. Особое внимание уделите тому, что система делает при повторной доставке уже обработанного события.
Критерии приёмки сформулируйте до выпуска. Каждый пункт должен давать однозначный ответ «выполнено» или «не выполнено», а не субъективную оценку. Если тест невозможно повторить автоматически, оставьте короткий регрессионный чек-лист с тестовыми данными и ожидаемыми статусами.
- Неавторизованный клиент не устанавливает сессию.
- Устройство A не подписывается и не публикует в namespace устройства B.
- Wildcard # отклоняется для обычного устройства.
- Отозванный credential перестаёт подключаться, не влияя на остальные.
- После перезапуска broker ACL и TLS остаются активными на всех listeners.
Типичные ошибки при исправлении
- Полагаться только на сложное имя topic.
- Использовать общий пароль во всех устройствах.
- Разрешать topic из client ID без подтверждённой связи с identity.
- Открывать административный порт для удобства удалённой диагностики.
- Отключать TLS-проверку на устройствах из-за ошибки сертификата.
Опаснее всего исправление, которое убирает заметный симптом ценой отключения проверки, ослабления прав или потери аудита. Такое изменение может сделать интерфейс «зелёным», но увеличить ущерб при следующем сбое. Если временный обход всё же необходим, ограничьте его срок, пользователей и область действия, добавьте мониторинг и заранее назначьте дату удаления.
Как предотвратить повторение
Профилактика строится вокруг явных контрактов, идемпотентных обработчиков, наблюдаемости и повторяемых релизов. Система должна не только корректно работать сейчас, но и быстро показывать нарушение правила после обновления, роста нагрузки или отказа интеграции. Ошибку, которая уже привела к потере времени, денег, данных или заявок, стоит закрепить автоматическим тестом.
Настройте мониторинг полного пользовательского пути, а не только доступности отдельных серверов. Техническая метрика должна быть связана с бизнес-результатом: заказ завершён, доступ выдан, файл восстановлен, событие обработано один раз, данные изолированы. Порог оповещения задавайте по нормальному профилю нагрузки и проверяйте, что уведомление содержит достаточно контекста для первого решения.
- Неуспешные входы и ACL denied по IP и identity.
- Подписки с широкими wildcard и доступ к системным topics.
- Одновременные подключения с одинаковым credential или client ID.
- Трафик и частота publish, выходящие за профиль устройства.
- Credentials без владельца, срока и последней активности.
Что подготовить для технического разбора
- Короткое описание ожидаемого и фактического поведения с точной последовательностью действий.
- Время возникновения, идентификатор тестового объекта и версии всех затронутых компонентов.
- Обезличенные фрагменты журналов до и после ошибки с единым correlation ID.
- Список последних изменений, результаты уже выполненных проверок и условия, при которых симптом исчезает.
- Безопасный доступ к тестовой среде либо минимальный пример, не содержащий паролей, токенов и персональных данных.
Частые вопросы
Достаточно ли VPN вместо TLS?
VPN уменьшает публичную поверхность, но не заменяет аутентификацию и ACL между устройствами. Лучше сочетать уровни защиты.
Можно ли использовать один сертификат на все устройства?
Это затрудняет отзыв и аудит. Уникальная identity существенно ограничивает последствия компрометации.
Как построить topic?
Использовать стабильный namespace tenant и device, а право на него выводить из серверной identity, не из доверия к строке клиента.
Когда нужна помощь специалиста
Если MQTT-broker открыт и topics не изолированы, я могу проверить listeners, TLS, auth и ACL, подготовить deny-by-default правила и безопасную ротацию. Для оценки нужны обезличенная конфигурация broker и примеры topic без секретов.