Service discovery должен публиковать адрес, достижимый именно из сети клиента. Внутренний localhost или host-only IP редко подходит другим контейнерам.
Разбирать такую проблему лучше от фактов: воспроизводимого примера, времени события, входных данных и журналов работы. Это позволяет исправить причину, а не временно скрыть симптом.
Как проявляется проблема
Клиент получает endpoint, но соединение завершается unavailable, connection refused, deadline exceeded или TLS name mismatch.
Что проверить сразу
- Зафиксируйте точное время, идентификатор пользователя, заказа, события или фоновой задачи.
- Сравните один успешный и один проблемный сценарий при одинаковых исходных условиях.
- Проверьте последние изменения в коде, конфигурации, правах, данных и внешних интеграциях.
- Сохраните логи до повторного запуска, очистки кеша или ручного изменения рабочих записей.
Основные причины
- Сервис регистрирует localhost или временный container IP.
- Health check проверяет другой порт, чем gRPC listener.
- DNS возвращает адрес из недоступной сети.
- TLS-сертификат не соответствует authority опубликованного endpoint.
Пошаговая диагностика
- Выведите выбранный endpoint на клиенте и проверьте маршрут из его namespace.
- Сравните listen address и advertised address сервиса.
- Проверьте health status и реальный gRPC health endpoint.
- Сверьте SNI, сертификат и target authority.
Как исправить
Перед изменением рабочих данных подготовьте резервную копию и способ отката. Правку вносите небольшими шагами, проверяя результат после каждого из них.
- Регистрируйте стабильное DNS-имя и правильный порт.
- Разделите адрес прослушивания и публикуемый адрес.
- Настройте health check на фактический gRPC-сервис.
- Удаляйте unhealthy instance и обновляйте resolver без долгого кеша.
Как проверить результат
- Каждый опубликованный endpoint доступен из сети клиента.
- При остановке instance он быстро исчезает из балансировки.
- Повторите исходный сценарий и минимум два пограничных случая.
- Проверьте соседние функции и права других ролей, которых могла коснуться правка.
- Посмотрите новые записи в логах после исправления, даже если интерфейс уже работает.
Чего не стоит делать
- Не отключайте авторизацию, валидацию и ограничения доступа только ради исчезновения ошибки.
- Не запускайте повторно финансовые, почтовые и массовые операции без проверки идемпотентности.
- Не меняйте рабочую базу массовым запросом без выборки, бэкапа и понятного отката.
- Не оставляйте токены, пароли, персональные данные и полные тела запросов в открытых логах.
Как не допустить повторения
- Тестируйте discovery между реальными сетевыми сегментами.
- Мониторьте долю unavailable по конкретным endpoint.
Что подготовить для технического разбора
- Ссылку на страницу, название интеграции, метод API или идентификатор фоновой задачи.
- Описание ожидаемого и фактического результата без передачи паролей и действующих токенов.
- Фрагмент лога за нужный период и пример данных, на которых ошибка воспроизводится.
- Список последних обновлений и сведения о рабочем окружении.
Частые вопросы
Можно ли обойтись без полной переделки?
Обычно да. Когда точка расхождения найдена, проблема решается локальной правкой обработчика, запроса, настройки, индекса или проверки доступа.
Почему ошибка возникает только иногда?
Чаще всего отличаются данные, роль пользователя, состояние кеша, порядок событий, устройство или ответ внешнего сервиса. Поэтому нужен конкретный воспроизводимый пример.
Итог
Рабочий discovery публикует достижимые адреса и подтверждает здоровье того же gRPC-порта, который используют клиенты.
Если самостоятельно найти причину не получилось, я могу изучить код и логи, воспроизвести проблему, внести безопасную правку и проверить рабочий сценарий.