Quorum
Состояние кластера и кворум контролируются как базовое условие безопасных изменений и обслуживания узлов.
Эксплуатация и развитие production-платформы виртуализации: кластерные вычисления, распределённое хранение, высокая доступность, резервное копирование и управляемое обслуживание.
По мере роста инфраструктуры требования к виртуализации вышли за рамки отдельных серверов. Production-нагрузкам требовались предсказуемая доступность, управляемое хранение, резервное копирование и возможность обслуживать платформу без лишних простоев.
Поэтому вычисления, storage, cluster control, backup, сеть и мониторинг рассматривались как части одной эксплуатационной платформы. Изменения на любом из этих уровней должны были учитывать влияние на остальные.
Схема намеренно абстрагирована. Она показывает функциональные уровни платформы без раскрытия клиентской адресации, имён узлов, топологии площадок и внутренних деталей безопасности.
Состояние кластера и кворум контролируются как базовое условие безопасных изменений и обслуживания узлов.
Критичные workloads размещаются с учётом возможностей HA и требований к восстановлению сервисов после отказов.
Перенос workloads между узлами используется для обслуживания, перераспределения нагрузки и плановых работ.
Работы выполняются по последовательной процедуре: проверка состояния, миграция нагрузок, обслуживание узла и контроль после возврата в кластер.
Ceph используется как распределённый storage-уровень там, где важны кластерная модель и доступность данных. Для задач, где это рациональнее, применяются отдельные файловые storage-сервисы.
Резервное копирование вынесено в отдельный PBS-контур. Это отделяет доступность production-storage от восстановления после ошибок, повреждения данных или других инцидентов и позволяет независимо управлять политиками хранения.
Платформа требует постоянной операционной работы: обновлений, проверки cluster health, мониторинга storage, контроля backup-задач, анализа инцидентов и планирования maintenance-окон.
Изменения выполняются с предварительной проверкой состояния платформы и возможностью отката. Повторяемые операции фиксируются в документации и runbooks, чтобы обслуживание не зависело от памяти конкретного инженера.
Виртуализация, распределённое хранение, HA, резервное копирование, сетевые контуры и мониторинг работают как единая эксплуатационная система. Это позволяет обслуживать платформу предсказуемо и развивать её без превращения инфраструктуры в набор независимых компонентов.
← Назад к проектам