Maksim Pikhenko CV
Максим Пихенко
ML Team Lead — LLM · Speech · OCR
Email: [email protected]
LinkedIn: https://linkedin.com/in/maksim-pikhenko-237575155
GitHub: https://github.com/masepi
Summary
Hands-on ML Team Lead с 15+ годами опыта в промышленной разработке ПО, включая 8+ лет создания production ML-систем и руководства их разработкой в областях speech, языковых моделей и NLP, OCR и обработки документов. Руководил research- и engineering-командами — от небольших групп до отделов численностью 15–25 человек — и при этом продолжал лично участвовать в проектировании архитектуры моделей и систем, обучении, оценке качества, оптимизации инференса и production-сервинге.
Сильный разработчик на C++ и Python с опытом полного цикла — от исследования и обучения модели до production на больших нагрузках, включая системы с нагрузкой до 100 млн inference-запросов в сутки. Занимался технической стратегией, наймом, развитием инженеров до руководителей групп и выводом ML-систем в продукты с многомиллионной аудиторией.
Ключевые достижения
- Спроектировал и обучил from scratch линейку ASR-моделей на 1B+ параметров на кластере из 300+ GPU: WER на русском языке в 2–3 раза ниже, чем у Whisper large-v3, в зависимости от домена; RTFx выше 1200 на A100; 4 крупных production-релиза.
- Спроектировал единую Speech API-платформу с нагрузкой до 100 млн inference-запросов в сутки и p50 latency 400 мс; сократил срок вывода новых версий моделей с 2–3 месяцев до 1 дня.
- Создал мультимодальную speech-language модель для ASR на основе существенно переработанного SLAM: примерно на 20% меньше ошибок по сравнению с лучшей production-моделью.
- Создал PDF-движок, лежащий в основе ABBYY FineReader и ABBYY PDF Transformer.
- Руководил переходом от классических алгоритмов OCR и обработки текста к нейросетевым языковым моделям в продуктах ABBYY для основных европейских языков, а также китайского, японского и корейского.
Навыки
ML: Machine Learning · Deep Learning · Neural Networks · Transformers · Language Models · Large Language Models (LLM) · Generative AI · Multimodal Speech-Text Models · NLP · OCR · Speech Recognition (ASR) · Text-to-Speech (TTS) · Speech Denoising · Voice Activity Detection (VAD) · Keyword Spotting (KWS) · Speaker Diarization · Self-Supervised Learning · Fine-Tuning · Distributed Training
Engineering: C++ · Python · PyTorch · CUDA · Архитектура ПО · Проектирование API · Model Serving & Inference Optimization · NVIDIA Triton · TensorRT · ONNX · Quantization · MLOps · PDF & Document Processing
Leadership: Управление разработкой · Руководство командами · Техническая стратегия · Найм и технические интервью · Менторинг · Управление R&D · Преподавание
Опыт работы
VK — Руководитель отдела речевых технологий
Апрель 2025 – июль 2026 · Москва / удаленно
Руководил отделом прикладного ML, отвечавшим за все ML-задачи в области речи и аудио: ASR, TTS, denoising, VAD, keyword spotting, diarization — полный цикл от исследований и разметки данных до обучения, интеграции, production-сервинга и мониторинга. Лично участвовал в проектировании системной архитектуры и архитектуры моделей, обучении.
- Unified Speech API: единая точка входа для всех речевых моделей — gateway с балансировкой нагрузки, квотами, автоскейлингом, мониторингом. Объединил около 14 клиентских интеграций ASR и множество других моделей в единый API и перевел production-эксплуатацию под ответственность отдела; срок выката новой версии модели сократился с 2–3 месяцев до 1 дня. До 100 млн inference-запросов в сутки, p50 — 400 мс.
- Собственная линейка ASR-моделей (1B+ параметров), спроектированная и обученная с нуля: SSL pretraining, SFT, PyTorch, TensorRT, NVIDIA Triton. крупномасштабный сбор данных, разметка, проектирование архитектуры, кластер из 300+ GPU для обучения. 4 крупных релиза; WER на русском языке в 2–3 раза ниже, чем у Whisper large-v3, в зависимости от домена; RTFx >1200 на одной A100.
- Мультимодальная speech-language модель на основе существенно переработанного SLAM для ASR: примерно на 20% меньше ошибок по сравнению с лучшей production-моделью.
- Вывел в production streaming и offline ASR; streaming denoising, mobile, web и server-сценариев на основе переработанных GTCRN + MP-SENet; VAD, превосходящий Silero VAD и TEN VAD на внутренних бенчмарках; zero-shot TTS с клонированием голоса, fast TTS, diarization, keyword spotting, а также ML-контроллер параметров кодека Opus.
- Руководил 15 инженерами и исследователями в двух грппах — ASR и Audio Quality & TTS; в 2026 году зона ответственности выросла до 25 человек - 5 групп ML инженеров и бэкенд разработчиков. Развивал и повышал инженеров до руководителей групп; нанимал ML-инженеров в свой и смежные отделы, включая руководителей групп.
- Основал и вел еженедельный ML R&D-семинар в компании с 30+ постоянными участниками; руководил студенческими исследованиями МФТИ и НИУ ВШЭ, разработал и прочитал курс по ML для студентов МФТИ.
Конфиденциальный стартап (NDA) — Руководитель ML-направления
Октябрь 2024 – март 2025
- Отвечал за ML-направление системы перевода жестового языка.
- Спроектировал и разработал ML-компоненты для распознавания и перевода жестового языка.
- Руководил обучением и оценкой моделей; интегрировал модели в прототип продукта.
Компания прекратила работу в марте 2025 года после срыва ранее согласованного финансирования.
ABBYY — Software Developer → Senior Software Developer → Principal Software Developer / Team Lead
Июль 2010 – октябрь 2024 (14 лет 4 месяца) · Москва, Россия / Нови-Сад, Сербия
Head of Language Model Group — Senior Software Developer → Principal Software Developer; Head of Group from 2019
Июнь 2018 – октябрь 2024
- Руководил группой языковых моделей в ABBYY, которая заменила классические алгоритмы распознавания OCR и алгоритмы обработки текста нейросетевыми языковыми моделями в продуктах ABBYY.
- Спроектировал, обучил и интегрировал в production множество нейросетевых архитектур для английского, французского и других европейских языков, а также китайского, японского и корейского, улучшив качество распознавания для всех этих языков.
- Разрабатывал базовые слои нейронных сетей и автоматизированный pipeline обучения моделей.
- Развивал open-source библиотеку ABBYY NeoML.
PDF Tools Development Group — Senior Software Developer, Head of Group
Май 2012 – июнь 2018
- Начал с нуля и возглавил разработку PDF-библиотеки, лежащей в основе ABBYY FineReader и ABBYY PDF Transformer — PDF-движка, сопоставимого по масштабу с PDF-библиотекой Adobe Acrobat.
- Реализовал чтение и запись PDF-файлов, редактирование, конвертацию в другие форматы, цифровые подписи, аннотации и интерактивное редактирование документов и многое другое.
OCR Export Group — Software Developer
Июль 2010 – май 2012
- Реализовал экспорт результатов OCR в RTF, DOCX, ODT, PDF, TXT, CSV и XPS.
Open Source
- ABBYY NeoML (github.com/neoml-lib/neoml) — разработал functional API и базовые слои нейронных сетей.
Преподавание
Московский физико-технический институт (МФТИ)
Преподаватель курса — «Речевые технологии и Edge ML» · 2025–2026
- Разработал и преподавал курс для студентов магистратуры; NPS курса — выше 80.
Приглашенный преподаватель · ноябрь 2014 – июль 2015
- Разработал и преподавал курс по форматам данных для студентов магистратуры.
Патент
Патент 8,548,241 B2 — Enhanced Multilayer Compression of Image Files Using OCR Systems
Образование
Московский физико-технический институт (МФТИ)
Магистр, прикладная математика — факультет инноваций и высоких технологий · 2004–2010
Языки
- Русский — родной
- Английский — B2