Топ-50 вопросов с собеседований на аналитика | data.hub
← На главную

Топ-50 вопросов с собеседований

Реальные вопросы с интервью на позиции Data Analyst и Product Analyst. Кликни на вопрос, чтобы увидеть ответ.

🗃️
SQL

В чем разница между WHERE и HAVING?+
WHERE фильтрует строки до группировки (до GROUP BY), а HAVING фильтрует группы после агрегации. WHERE работает с отдельными строками, HAVING - с результатами агрегатных функций (COUNT, SUM, AVG и т.д.).
Объясни разницу между INNER, LEFT, RIGHT и FULL JOIN+
INNER JOIN возвращает только совпадающие строки из обеих таблиц. LEFT JOIN возвращает все строки из левой таблицы + совпадения из правой (NULL если нет совпадения). RIGHT JOIN - наоборот. FULL JOIN возвращает все строки из обеих таблиц.
Что такое оконные функции? Приведи пример+
Оконные функции выполняют вычисления по группе строк, связанных с текущей строкой, без свертки данных. Пример - ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY date) для нумерации заказов каждого пользователя.
Как найти дубликаты в таблице?+
SELECT column, COUNT(*) as cnt FROM table GROUP BY column HAVING COUNT(*) > 1;
Напиши запрос для расчета накопительной суммы+
SELECT date, revenue, SUM(revenue) OVER (ORDER BY date) as cumulative_revenue FROM daily_sales;
Чем отличается UNION от UNION ALL?+
UNION объединяет результаты и удаляет дубликаты. UNION ALL объединяет все, включая дубликаты. UNION ALL работает быстрее, так как не тратит ресурсы на удаление дубликатов.
Как работает GROUP BY с несколькими колонками?+
Группировка происходит по уникальным комбинациям значений всех указанных колонок. Например, GROUP BY city, product создаст отдельную группу для каждой комбинации город + продукт.
Что такое CTE и зачем он нужен?+
CTE (Common Table Expression) - временный именованный результат запроса, определяемый через WITH. Делает сложные запросы читаемыми, позволяет переиспользовать подзапросы и упрощает отладку.
Разница между ROW_NUMBER, RANK и DENSE_RANK?+
ROW_NUMBER даёт уникальный номер каждой строке (1,2,3,4). RANK при равных значениях ставит одинаковый ранг и пропускает следующие (1,1,3). DENSE_RANK тоже даёт одинаковый ранг, но не пропускает (1,1,2).
Что такое CTE и когда использовать вместо подзапроса?+
CTE (WITH ... AS) — временный именованный результат внутри запроса. Делает сложные запросы читаемее, позволяет переиспользовать промежуточный результат и писать рекурсию. Подзапрос удобнее для простых одноразовых случаев.
Как посчитать долю (процент) от общего?+
Через оконную функцию: SUM(x) OVER () даёт общий итог. Пример: revenue * 100.0 / SUM(revenue) OVER () AS share_pct. Важно умножать на 100.0, чтобы не потерять дробную часть.
Чем UNION отличается от UNION ALL?+
UNION объединяет и убирает дубликаты (медленнее — нужна сортировка/хеш). UNION ALL просто склеивает все строки, включая дубликаты (быстрее). Если дублей быть не может — используй UNION ALL.
Как найти вторую по величине зарплату?+
Три способа: 1) SELECT MAX(salary) WHERE salary < (SELECT MAX(salary) ...); 2) через оконку DENSE_RANK() OVER (ORDER BY salary DESC) = 2; 3) SELECT DISTINCT salary ORDER BY salary DESC LIMIT 1 OFFSET 1.

📊
Продуктовые метрики

Что такое Retention и как его считать?+
Retention - процент пользователей, вернувшихся в продукт через N дней после первого визита. Retention Day 7 = (пользователи, вернувшиеся на 7 день / когорта первого дня) × 100%. Ключевая метрика для оценки "липкости" продукта.
В чем разница между ARPU и ARPPU?+
ARPU (Average Revenue Per User) = Выручка / Все пользователи. ARPPU (Average Revenue Per Paying User) = Выручка / Платящие пользователи. ARPPU всегда выше ARPU и показывает средний чек платящих.
Как рассчитать LTV?+
LTV = ARPU × Lifetime (средний срок жизни клиента). Для подписочных моделей: LTV = ARPU / Churn Rate. Важно: LTV должен быть минимум в 3 раза больше CAC для здоровой экономики.
Что такое когортный анализ?+
Группировка пользователей по дате первого действия (регистрации, покупки) и отслеживание их поведения во времени. Позволяет сравнивать поколения пользователей и видеть тренды.
Метрика DAU упала на 20%. Как будешь искать причину?+
1) Проверить технические проблемы (баги, падение серверов). 2) Сегментировать по платформам, странам, источникам трафика. 3) Посмотреть на новых vs старых пользователей. 4) Проверить изменения в продукте или маркетинге. 5) Сравнить с историческими данными (сезонность).
Что такое North Star метрика?+
Главная метрика продукта, которая отражает ценность для пользователя и коррелирует с ростом бизнеса. Примеры: для Spotify - время прослушивания, для Airbnb - количество забронированных ночей.
Что такое DAU, WAU, MAU и stickiness?+
DAU/WAU/MAU — уникальные активные пользователи за день/неделю/месяц. Stickiness = DAU/MAU — насколько часто пользователи возвращаются (чем ближе к 1, тем «липче» продукт).
Что такое Retention и чем classic отличается от rolling?+
Retention — доля вернувшихся пользователей на день N. Classic (Day-N) считает вернувшихся именно в день N. Rolling — вернувшихся в день N или позже. Rolling обычно выше и сглаженнее.
В чём разница ARPU и ARPPU?+
ARPU = выручка / всех пользователей. ARPPU = выручка / только платящих. ARPPU всегда ≥ ARPU и показывает ценность платящего клиента.
Что такое LTV и как его посчитать?+
LTV — сколько денег приносит клиент за всё время жизни. Простая формула: ARPU × средний срок жизни × маржа. Точнее — по когортам: суммарная выручка когорты / размер когорты.
Как выбрать North Star метрику?+
Она должна отражать ценность для пользователя И рост бизнеса, быть опережающей (не выручка постфактум) и управляемой командой. Пример: для доставки — число заказов, для соцсети — время в ленте.

🔬
A/B тесты и статистика

Что такое статистическая значимость?+
Вероятность того, что наблюдаемый результат не случаен. Обычно используют порог p-value < 0.05 (95% уверенность). Если p-value меньше порога - результат статистически значим.
Что такое ошибки I и II рода?+
Ошибка I рода (False Positive) - нашли эффект там, где его нет. Ошибка II рода (False Negative) - не нашли эффект там, где он есть. Уменьшение одной ошибки увеличивает другую.
Как определить размер выборки для A/B теста?+
Зависит от: 1) базовой конверсии, 2) минимального детектируемого эффекта (MDE), 3) статистической мощности (обычно 80%), 4) уровня значимости (обычно 5%). Есть калькуляторы: Evan Miller, Optimizely.
Что такое AA-тест и зачем он нужен?+
Тест, где обе группы получают одинаковый опыт (без изменений). Нужен для проверки корректности системы сплитования. Если AA-тест показывает значимую разницу - проблема в методологии.
Когда нельзя использовать A/B тест?+
Когда: 1) мало трафика для достижения значимости, 2) изменение влияет на всех пользователей (например, цены), 3) есть сетевые эффекты между группами, 4) нужны долгосрочные выводы, а времени мало.
Что такое p-value простыми словами?+
Вероятность увидеть такой (или больший) эффект при условии, что на самом деле разницы нет. Маленький p (< 0.05) — различие вряд ли случайно. p — это НЕ вероятность того, что гипотеза верна.
Что такое ошибки I и II рода?+
Ошибка I рода (α) — увидели эффект, которого нет (ложная тревога). Ошибка II рода (β) — не заметили реальный эффект. Мощность теста = 1 − β.
Что такое мощность теста и от чего зависит?+
Мощность — вероятность обнаружить реальный эффект. Растёт с размером выборки, величиной эффекта (MDE) и α; падает при высокой дисперсии. Обычно целятся в 80%.
Зачем нужна поправка на множественные сравнения?+
Проверяя много метрик сразу, вероятность хотя бы одной ложной находки растёт. Поправки (Bonferroni: α/n или Benjamini-Hochberg) снижают порог, чтобы контролировать долю ложных срабатываний.
Что такое ошибка подглядывания (peeking)?+
Когда останавливают тест, как только p стал < 0.05. Это раздувает ошибку I рода — «значимость» появляется случайно. Нужно фиксировать размер выборки заранее или использовать sequential-методы.

🧠
Кейсы и задачи

Конверсия корзины упала. Как найдешь причину?+
1) Сегментация по устройствам, браузерам, платформам. 2) Анализ воронки - на каком шаге отваливаются. 3) Проверка технических ошибок. 4) Сравнение новых и старых пользователей. 5) Анализ изменений в продукте/маркетинге в этот период.
Как бы ты измерил успех новой фичи?+
1) Определить цель фичи и целевую метрику. 2) Выбрать guardrail-метрики (что не должно упасть). 3) Провести A/B тест. 4) Дождаться статистической значимости. 5) Проверить долгосрочный эффект (новизна может искажать).
Пользователь говорит, что фича не работает, но данные показывают рост. Что делать?+
1) Проверить сегменты - возможно, проблема у части пользователей. 2) Убедиться в корректности метрики. 3) Провести качественное исследование (интервью). 4) Возможно, метрика не отражает реальную ценность.
Как найти причину падения выручки?+
Разложить метрику: выручка = пользователи × конверсия × средний чек. Сегментировать (устройство, регион, канал, новизна). Проверить сезонность, релизы, баги трекинга, внешние события. Найти, какой сегмент или множитель просел.
Как оценить эффект фичи без A/B теста?+
Before/after с поправкой на тренд, difference-in-differences (сравнение с контрольной группой), синтетический контроль, регрессия с учётом факторов. Все слабее A/B — важно контролировать внешние факторы.
DAU вырос, а выручка нет. Почему?+
Новые пользователи могут быть неплатящими (плохой канал/акция), выросла доля бесплатного сегмента, упал ARPPU, или прирост в регионах с низкой монетизацией. Разложить выручку по сегментам.
Как приоритизировать гипотезы роста?+
По фреймворку ICE/RICE: Reach × Impact × Confidence / Effort. Оценить ожидаемый эффект на ключевую метрику и стоимость реализации, брать с лучшим соотношением.
Как обнаружить аномалию или фрод в данных?+
Статистически: отклонение от скользящего среднего, z-score, IQR, резкие скачки, дубли, нереалистичные паттерны (сотни действий в секунду с одного id). Плюс бизнес-правила и сравнение сегментов.

💼
Общие вопросы

Расскажи о себе / своем опыте+
Структура: 1) Кратко о бэкграунде (30 сек). 2) Релевантный опыт с конкретными достижениями. 3) Почему интересна эта позиция/компания. Не пересказывай резюме - выдели главное и покажи результаты.
Почему хочешь работать аналитиком?+
Расскажи про интерес к данным и решению бизнес-задач. Приведи примеры, когда анализ данных тебя увлекал. Покажи, что понимаешь суть работы аналитика - не просто считать, а влиять на решения.
Расскажи о сложном проекте+
Используй STAR: Situation (контекст), Task (задача), Action (что делал), Result (результат с цифрами). Покажи свой вклад и чему научился.
Какие метрики ты смотришь каждый день?+
Зависит от продукта, но обычно: активные пользователи (DAU), ключевая конверсия, выручка/GMV, retention и здоровье воронки. Плюс алерты на аномалии, чтобы ловить проблемы сразу.
Как объясняешь сложные результаты нетехническим людям?+
Начать с вывода и его влияния на бизнес, а не с метода. Одна главная мысль, простые визуализации, без жаргона, аналогии. Всегда отвечать на вопрос «и что теперь делать?».
Как ты проверяешь качество данных?+
Проверки на пропуски, дубли, выбросы, консистентность типов и диапазонов, сверку сумм с источником, свежесть данных. Автоматизирую проверки и не доверяю данным без валидации.
Как работать со стейкхолдером, который хочет «нужный» результат?+
Оставаться честным: показать данные как есть, объяснить методологию и ограничения. Понять бизнес-цель за запросом и предложить корректный способ её достичь. Репутация аналитика — в объективности.
Какие вопросы задать интервьюеру в конце?+
Про задачи роли и метрики успеха, устройство данных и стек, как принимаются решения на данных, состав команды и процессы, чего ждут от кандидата в первые 3 месяца. Показывает интерес и вовлечённость.

Хочешь подготовиться к собеседованиям?

Ментор проведет mock-интервью и поможет подготовиться к реальным собеседованиям

Узнать про менторство →