Перейти к содержимому
На этой странице

Эксплуатация data-платформы

Все темы Data Engineer

Как разделить ресурсы кластера между критичными и фоновыми job?

Сначала ставят requests/limits и quotas по namespace или команде, затем разделяют очереди или scheduler pools с гарантированной долей и пределом. Критичным job дают обоснованный priority, но защищают систему от starvation фоновых задач через fairness и preemption policy. Ограничивают параллелизм тяжелых pipeline. Метрики queue wait, utilization, throttling и SLA misses показывают, нужно ли менять доли или сам workload. Решение оценивают через SLA, очередь, unit cost и сценарий отказа, а не по одной средней загрузке.


Как оценить полную стоимость Data Delivery System?

TCO включает compute, storage, межзонный и внешний network traffic, managed-service и лицензионные платежи. К ним добавляют разработку интеграций, миграцию, поддержку on-call, обновления, наблюдаемость, security и compliance. Стоимость считают по workload-сценариям и росту, включая idle capacity, backfill и disaster recovery. Полезная единица сравнения: стоимость доставленного набора, TB или соблюденного SLA, а не только счет облака. Решение оценивают через SLA, очередь, unit cost и сценарий отказа, а не по одной средней загрузке.


Как распределять стоимость data-платформы между командами?

Каждый ресурс, pipeline и dataset получает owner, cost center и labels; billing export связывает compute, queries, storage и network с командами. Неразмеченное и общее распределяют по прозрачному драйверу, например bytes processed или reserved capacity, сохраняя отдельную строку shared platform. Командам показывают budget, forecast, idle resources и unit cost pipeline. Chargeback вводят после периода showback, когда качество атрибуции уже измерено. Решение оценивают через SLA, очередь, unit cost и сценарий отказа, а не по одной средней загрузке.

Вопросы и ответы

Не нашли ответ? Напишите мне в чат. Я делаю Шпаргалку и сам отвечаю на сообщения. Расскажите, что не работает или чего вам не хватает. Может, смогу сразу взять это в работу.

Откуда взяты вопросы?

Из реальных собеседований. Основой подборки стал опыт Вадима Новосёлова: он проходил интервью и записывал вопросы. Подробнее о материалах.

Насколько эти вопросы актуальны?

Эти вопросы встречались нам на реальных собеседованиях в 2025 году. Мы регулярно проходим собеседования и пополняем подборку новыми вопросами. Основы профессии и ключевые технологии остаются востребованными годами, а детали конкретных инструментов и версий стоит сверять с текущей документацией.

На какой уровень рассчитана подборка?

Мы проходили собеседования на вакансии уровня Middle+, а иногда и на Senior-позиции. Вопросы из этих интервью вошли в подборку. Направления работы: Data Engineer, ETL-разработчик. Глубина обсуждения зависит от вакансии: будь готов объяснить основную идею, привести практический пример и разобрать ограничения и альтернативы решения.

Этот вопрос точно будет на моём собеседовании?

Гарантии нет: набор вопросов зависит от компании, задач команды, уровня вакансии и самого интервьюера. Эти вопросы уже встречались на реальных собеседованиях, но на твоём интервью ту же тему могут проверить другой формулировкой, практической задачей или обсуждением твоего опыта. Используй подборку, чтобы разобраться в теме: объясняй идею своими словами, приводи примеры и готовься обсудить ограничения и альтернативы решения. Так будет проще ответить и на знакомый вопрос, и на неожиданные уточнения.