Классические темы блок 1
Архитектура и масштабируемость
- Легаси-система на миллионы строк: как вы вернули управляемость — и что в этом смог и не смог агент
- Каскадный сбой: одна плохая конфигурация уронила всю систему — анатомия инцидента и защита от расползания отказа
- Честная цена модных паттернов: DDD, Clean Architecture, микросервисы «по рынку труда» — что стало с задержками, инцидентами и командой
- Kafka/GraphQL/Kubernetes, внедрённые не под масштаб: как распознать и как откатиться
- Хрупкие межсервисные вызовы: повторные попытки, трассировка, потеря логов при многосервисных транзакциях
PostgreSQL
- Промахи планировщика на масштабе: методика разбора EXPLAIN, которая экономит дни, а не советы «добавьте индекс»
- Репликация и DR без потери транзакций: физическая vs логическая на реальных сбоях, зависшие recovering-реплики
- Массовые UPDATE/DELETE на сотнях миллионов строк и частичный бэкап — безопасные способы, которых нет в документации
- Высокая доступность (HA) всерьёз: Patroni, etcd, пулеры, шардирование — что из этого зрело, а что заброшено
- Битые страницы, разрастание WAL, раздувание широких таблиц: диагностика и восстановление
ClickHouse
- Систематика эксплуатационных граблей: too many parts, MEMORY_LIMIT_EXCEEDED, зависшие DDL и мутации — вместо фольклора
- Апгрейд ClickHouse без поломки прода: методика, каталог несовместимых изменений, контрольный список
- Дедупликация без ловушек: ReplacingMergeTree, FINAL, MV над Distributed
- Тихая порча результатов: алиасы, CTE, оптимизатор JOIN — как ловить неправильные данные, которые «работают»
- Keeper и координация: катастрофоустойчивость, потеря ДЦ, клонирование кластера
- Kafka → ClickHouse без потерь: что делать с молчаливыми сбоями цепочки
- Шардирование «как у всех» и его цена: мифы, по которым проектируют кластеры, и что случается под нагрузкой
Другие СУБД
- YDB в проде: реальная утилизация ресурсов, апгрейды, границы применимости
- Tarantool, MongoDB, Redis/Valkey или MySQL — доклад по любой из них: опыт эксплуатации на масштабе с честными цифрами отказов
СУБД под агентную нагрузку
- База данных для агента: от query-driven к task-driven — что должно измениться в планировщике и исполнителе, чтобы агент получал гарантии свежести и структурированную обратную связь
- Агентская память поверх СУБД: происхождение данных, версии, права, аудит действий — проверяемая память вместо длинной истории чата
- Честный HTAP: свежесть как часть корректности — что именно видит аналитический запрос, вместо «примерно свежих» реплик; доклад от разработчиков СУБД или опыт на стороне приложения
Data Engineering
- Kafka и потоковые пайплайны: молчаливые сбои репликации, повреждение данных во Flink/Spark — как строить контроль целостности
- CDC на проде: потери метаданных, неполные DELETE-события
- RAG на реальных данных: грязные корпуса, потеря полноты (recall), задержки, маскирование персональных данных на русском
Platform Engineering
- Kubernetes честно: во что обходится содержание кластеров и когда он не нужен
- Сеть кластера как источник трудноуловимых сбоев: CNI, апгрейды service mesh, graceful drain
- Хранилище в кластере: CSI/FUSE против POSIX-семантики, опыт Longhorn/Linstor/MinIO и их альтернатив
- CI/CD-пайплайн на десятки тысяч строк: как вернуть его под контроль
- Инфраструктура дорожает и запирает: FinOps, выход из vendor lock, миграции без остановки
- Карта инфраструктуры: как построить видимость связей ВМ ↔ сервисы, когда её никогда не было
Безопасность
- Атаки на цепочку поставок: компрометации npm / PyPI / GitHub Actions — как строить защиту
- Секреты и выдача учётных данных на масштабе — теперь ещё и для агентов
- Инъекции нового поколения: вывод LLM, попадающий в shell
- Управление уязвимостями (CVE) в инфраструктуре: как устроен процесс поиска, приоритизации и закрытия дыр — с метриками, которые доказывают, что он работает
- Разбор реального взлома: майнеры, руткиты, серверы, скомпрометированные сразу после установки (анонимизированный разбор — нормально)
SRE и эксплуатация
- Наблюдаемость на масштабе: стоимость ELK/Loki/OpenSearch, потери данных в OpenTelemetry — архитектуры, которые не разоряют
- Управление инцидентами в РФ: чем заменить Grafana OnCall и PagerDuty — дежурства, эскалации, инструменты
- Как перестать отлаживать сеть вслепую: устройство сети под вашим приложением, границы ответственности — где ваша зона, где провайдер, где «дикий интернет», физика задержек
- Баги, которые живут только в проде: почему тестовая среда не воспроизводит боевые данные и что с этим делать
- Постмортем в паре «человек + агент»: как реально ускоряется следующий инцидент
Тестирование
- Как проверить сделанное агентом — самый частый вопрос индустрии сейчас
- Все знают, что «тесты нужны». Расскажите, как внедрить тестирование, которое реально ловит проблемы, а не закрывает отчётность
Языки и стеки
- C++ на проде: UB, расходящиеся компиляторы, боль сборки — и может ли сюда агент
- Низкоуровневая конкурентность: гонки, отмена задач, утечки потоков и горутин — разборы реальных багов на любом языке
- Наивные алгоритмы под нагрузкой: как копии, мьютексы и логирование убивают время отклика
- Один код — разные результаты: расхождения между продом и локальной средой и между платформами, которые стоили инцидентов
- Go в командах: архитектурная культура против лапши — с примерами до/после
- Агентное программирование в низкоуровневых задачах: на Python агент пишет сам — а что с C++ на уровне регистров, SIMD и ядра? Покажите на своём коде, где он помогает, а где путается
Edge, IoT, HPC, медиа и специализированные темы
- Распределённые системы, которые нельзя проверить запуском: консенсус, консистентность, верификация
- GPU-вычисления и оптимизация инференса как highload-задача (продуктовый инференс — сюда, платформа для инженеров — в «Агентную платформу»)
- Медиастриминг под нагрузкой: RTP/RTSP, задержки, отладка
- Прошивки и железо: когда документации нет — обратная разработка чужих устройств и SoC, ограничения, «умные» устройства в проде
DevOps-практики и культура
- Критичные знания живут в головах и личных промптах сотрудников: опыт формализации в базу знаний, которую читают и люди, и агенты
- Роль девопс/платформенного инженера: что от неё останется и что появится
- Как агенты меняют экономику инженерных команд: опыт перестройки процессов с цифрами до/после
AI в SDLC блок 2 · приоритет
- Нечеловеческая разработка: как устроен цикл работы агента, его обвязка и подготовка контекста (loop / harness / context engineering) — с какими практиками агент работает лучше
- Границы применимости агентов: где работают, где ломаются — сложная архитектура, распределённые системы, махровое легаси
- AI в легаси: заставить агента не испортить пятнадцатилетнюю Java
- LLM в продукте: фичи для пользователей на моделях — поиск, генерация, ассистенты — под производственной нагрузкой
- Верификация работы агента: методики, инструменты, честные ограничения — «пока не умеем» тоже принимается, если показан путь
Агентная платформа блок 3 · новая секция
- Архитектура агентной платформы: с чего начать и почему платформы нынче ещё нужнее
- On-premise инференс: железо, vLLM/llama.cpp на проде, падения под нагрузкой, KV-кэш, мульти-GPU, OOM
- Шлюз и доступы для агентов: широкий доступ без ручного согласования на каждый чих — как выдавать, чем ограничивать и как не потерять данные и бизнес
- Ограничители (guardrails): чем резать возможности агента, не убивая его пользу
- Экономика агентной платформы: сколько это стоит и как посчитать. Никто не умеет: и методика, и честное «мы считали так — и вот где ошиблись» соберут зал
- Насколько агентную платформу можно построить самими агентами — и где предел
- Архитектура GPU-кластера под инференс: интерконнект, шедулинг, мультитенантность, утилизация
- Экономика инференса: своя модель против внешнего API — с расчётом, где что выгоднее
Российские боли блок 4 · новый блок
- Архитектура связности, когда любой кусок может отвалиться: работа сразу с несколькими облачными провайдерами России, деградация без падения
- Зависимости и репозитории: как жить, когда GitHub, PyPI и Docker Hub доступны через раз — зеркала, проксирование, вендоринг
- DDoS-защита в зоне .ru: международные сервисы заблокированы, локальные пробиваются — что реально работает
- TLS-сертификаты: жизненный цикл без инцидентов после ухода привычных CA
- Мониторинг и оповещения, когда пуши и SaaS-сервисы ненадёжны
- 152-ФЗ, СОРМ, реестры: комплаенс как инженерная задача, а не бумажная
- Импортозамещение с открытыми глазами: честные сравнения, реальные миграции, цена вопроса
- Надёжность на российских хостерах: SLA, которых нет, и архитектура поверх них
- Железо для инференса под санкциями: параллельный импорт, китайские карты, аренда мощностей — как считать риски
Как этим пользоваться. Нашли свой пункт — подавайте заявку. Закрываете тему частично или с другого угла — тоже подавайте: список описывает боли, которые мы хотим закрыть, а не жёсткие формулировки названий.
Подать заявку →