разбираю рынок виртуализации в РФ
Понятное лицензирование действительно решает. Тут только один нюанс. У KVM-оркестраторов недорогой сам оркестратор, а бюджет добирают хранилище и сеть рядом, часто со своими лицензиями.
В vStack платите за одну гиперконвергентную платформу, SDS и SDN уже внутри, лицензия считается от физических ресурсов кластера без доплат. Захотите, сравним TCO на ваших цифрах.
Хорошие слова. Переехать это полдела, дальше с этим жить. Если vmmanager зашёл по админству, значит выбрали по делу, а не по маркетингу.
Мы целились в то же самое. Хранилище, сеть и вычисления держим в одной платформе, управляем из одной панели и через API. Когда инфраструктура выходит за один ЦОД, объединяем кластеры в глобальную инфраструктуру, и виртуальные ЦОДы с сетями работают поверх всех площадок сразу. Отказоустойчивость закрываем геораспределённым кластером на два ЦОДа с синхронной репликацией, чтобы отказ целой площадки не ронял сервисы.
Себя не идеализируем 🙂 но задачу ставили такую. Захотите сравнить на своём сценарии, покажем на стенде.
Экономия складывается из трех вещей: плотности размещения ВМ, лицензирования по сокетам и отсутствия отдельной СХД.
Стоимость одной ВМ это (железо плюс лицензии), деленные на число ВМ. Чем выше плотность, тем ниже цена за машину, и основную экономию дает именно она, а не только железо.
Лицензирование считается по сокетам, без обязательных бандлов.
Отдельной СХД нет: хранение живет внутри тех же серверов. Масштабирование простое: нужна емкость, докупаете диски; нужно больше вычислений, докупаете серверы и лицензии. Отдельно проектировать и закупать систему хранения не приходится.
Чтобы наглядно посчитать число ВМ на конкретном кластере, нужны параметры узлов (число ядер и сокетов, объем RAM, объем и тип дисков), средний размер ВМ (vCPU, RAM, диск), тип нагрузки и желаемый запас на отказ узла.
Хотите, сделаю расчет под вас?
Спасибо за ваш комментарий.
Про задержку канала между площадками это зона сетевой инфраструктуры: физическое расстояние, оптика, оборудование, дизайн сети и SLA оператора связи. Наше ПО на неё не влияет и влиять не может. Что делаем мы: задаём требование к каналу и корректно работаем в его рамках. В механике вы абсолютно правы.
Про split-brain. А вот это уже наша зона ответственности, и здесь мы даём гарантию. На независимой третьей площадке ставится quorum-сервер, даже при полном обрыве канала целостность данных сохраняется, и это гарантирует платформа, а не качество линии.
Если копать до фундамента: гипервизор у vStack из BSD-семейства (bhyve), а не Linux/KVM, а программное хранилище построено на ZFS, а не на Ceph.
Технические специалисты и администраторы на 90% умеют работать в KVM и Ceph, и связка bhyve/ZFS звучит как «экзотика, под которую не найти людей и не у кого спросить».
Ключевой момент, заказчик администрируете vStack, а не bhyve напрямую. Ровно как VMware-администраторы никогда не лезли в ядро ESXi. Жизненный цикл ВМ, HA, живая миграция, снапшоты, управление сетью и хранилищем, всё через единую панель и API vStack. Знание внутренностей bhyve для эксплуатации не требуется, а низкоуровневый слой и его сопровождение берет на себя вендор.
ZFS - одна из зрелых и проверенных технологий хранения в индустрии (copy-on-write, сквозные контрольные суммы, снапшоты, компрессия, самовосстановление данных). По операционной сложности ZFS обычно проще и предсказуемее Ceph, а не наоборот: Ceph как раз известен тем, что требует отдельной команды, тонкого тюнинга и постоянного внимания. Получаем снижение операционного риска, а не повышение.
Хотите предоставим тест в облаке, посмотрите продукт?
Тоже считали TCO по нескольким платформам, так что заход правильный. Понятное лицензирование стоит дорого.
Одна деталь про KVM-оркестраторы вроде VMmanager. Сам оркестратор недорогой, но итоговую смету добирает всё вокруг него. Хранилище берёте отдельно, внешнюю СХД или сторонний SDS со своей лицензией. Сеть нередко тоже. На этих слоях бюджет и растёт, хотя в прайсе виртуализации их не видно.
Портрет заказчика у нас другой. Мы смотрим на полный TCO на масштабе, цена лицензии тут вторична. В расчёт идут эксплуатация внешнего хранилища, зарплаты дефицитных senior-инженеров и цена простоя. Добавьте катастрофоустойчивость active-active на две площадки, RPO около нуля и RTO порядка двух минут, без внешней СХД. На связке KVM и Ceph такой сценарий превращается в отдельный дорогой проект с рисками.
На небольшом и среднем контуре ваш расклад рабочий. Дальше решает масштаб. Посчитайте полный TCO с людьми, простоями и катастрофоустойчивостью, а не только лицензию и железо, и цифра сдвигается. Скиньте свой объём, сравним расчёт.