Maksim Pikhenko CV

Максим Пихенко

ML Team Lead — LLM · Speech · OCR

Email: [email protected]
LinkedIn: https://linkedin.com/in/maksim-pikhenko-237575155
GitHub: https://github.com/masepi


Summary

Hands-on ML Team Lead с 15+ годами опыта в промышленной разработке ПО, включая 8+ лет создания production ML-систем и руководства их разработкой в областях speech, языковых моделей и NLP, OCR и обработки документов. Руководил research- и engineering-командами — от небольших групп до отделов численностью 15–25 человек — и при этом продолжал лично участвовать в проектировании архитектуры моделей и систем, обучении, оценке качества, оптимизации инференса и production-сервинге.

Сильный разработчик на C++ и Python с опытом полного цикла — от исследования и обучения модели до production на больших нагрузках, включая системы с нагрузкой до 100 млн inference-запросов в сутки. Занимался технической стратегией, наймом, развитием инженеров до руководителей групп и выводом ML-систем в продукты с многомиллионной аудиторией.

Ключевые достижения

  • Спроектировал и обучил from scratch линейку ASR-моделей на 1B+ параметров на кластере из 300+ GPU: WER на русском языке в 2–3 раза ниже, чем у Whisper large-v3, в зависимости от домена; RTFx выше 1200 на A100; 4 крупных production-релиза.
  • Спроектировал единую Speech API-платформу с нагрузкой до 100 млн inference-запросов в сутки и p50 latency 400 мс; сократил срок вывода новых версий моделей с 2–3 месяцев до 1 дня.
  • Создал мультимодальную speech-language модель для ASR на основе существенно переработанного SLAM: примерно на 20% меньше ошибок по сравнению с лучшей production-моделью.
  • Создал PDF-движок, лежащий в основе ABBYY FineReader и ABBYY PDF Transformer.
  • Руководил переходом от классических алгоритмов OCR и обработки текста к нейросетевым языковым моделям в продуктах ABBYY для основных европейских языков, а также китайского, японского и корейского.

Навыки

ML: Machine Learning · Deep Learning · Neural Networks · Transformers · Language Models · Large Language Models (LLM) · Generative AI · Multimodal Speech-Text Models · NLP · OCR · Speech Recognition (ASR) · Text-to-Speech (TTS) · Speech Denoising · Voice Activity Detection (VAD) · Keyword Spotting (KWS) · Speaker Diarization · Self-Supervised Learning · Fine-Tuning · Distributed Training

Engineering: C++ · Python · PyTorch · CUDA · Архитектура ПО · Проектирование API · Model Serving & Inference Optimization · NVIDIA Triton · TensorRT · ONNX · Quantization · MLOps · PDF & Document Processing

Leadership: Управление разработкой · Руководство командами · Техническая стратегия · Найм и технические интервью · Менторинг · Управление R&D · Преподавание


Опыт работы

VK — Руководитель отдела речевых технологий

Апрель 2025 – июль 2026 · Москва / удаленно

Руководил отделом прикладного ML, отвечавшим за все ML-задачи в области речи и аудио: ASR, TTS, denoising, VAD, keyword spotting, diarization — полный цикл от исследований и разметки данных до обучения, интеграции, production-сервинга и мониторинга. Лично участвовал в проектировании системной архитектуры и архитектуры моделей, обучении.

  • Unified Speech API: единая точка входа для всех речевых моделей — gateway с балансировкой нагрузки, квотами, автоскейлингом, мониторингом. Объединил около 14 клиентских интеграций ASR и множество других моделей в единый API и перевел production-эксплуатацию под ответственность отдела; срок выката новой версии модели сократился с 2–3 месяцев до 1 дня. До 100 млн inference-запросов в сутки, p50 — 400 мс.
  • Собственная линейка ASR-моделей (1B+ параметров), спроектированная и обученная с нуля: SSL pretraining, SFT, PyTorch, TensorRT, NVIDIA Triton. крупномасштабный сбор данных, разметка, проектирование архитектуры, кластер из 300+ GPU для обучения. 4 крупных релиза; WER на русском языке в 2–3 раза ниже, чем у Whisper large-v3, в зависимости от домена; RTFx >1200 на одной A100.
  • Мультимодальная speech-language модель на основе существенно переработанного SLAM для ASR: примерно на 20% меньше ошибок по сравнению с лучшей production-моделью.
  • Вывел в production streaming и offline ASR; streaming denoising, mobile, web и server-сценариев на основе переработанных GTCRN + MP-SENet; VAD, превосходящий Silero VAD и TEN VAD на внутренних бенчмарках; zero-shot TTS с клонированием голоса, fast TTS, diarization, keyword spotting, а также ML-контроллер параметров кодека Opus.
  • Руководил 15 инженерами и исследователями в двух грппах — ASR и Audio Quality & TTS; в 2026 году зона ответственности выросла до 25 человек - 5 групп ML инженеров и бэкенд разработчиков. Развивал и повышал инженеров до руководителей групп; нанимал ML-инженеров в свой и смежные отделы, включая руководителей групп.
  • Основал и вел еженедельный ML R&D-семинар в компании с 30+ постоянными участниками; руководил студенческими исследованиями МФТИ и НИУ ВШЭ, разработал и прочитал курс по ML для студентов МФТИ.

Конфиденциальный стартап (NDA) — Руководитель ML-направления

Октябрь 2024 – март 2025

  • Отвечал за ML-направление системы перевода жестового языка.
  • Спроектировал и разработал ML-компоненты для распознавания и перевода жестового языка.
  • Руководил обучением и оценкой моделей; интегрировал модели в прототип продукта.

Компания прекратила работу в марте 2025 года после срыва ранее согласованного финансирования.

ABBYY — Software Developer → Senior Software Developer → Principal Software Developer / Team Lead

Июль 2010 – октябрь 2024 (14 лет 4 месяца) · Москва, Россия / Нови-Сад, Сербия

Head of Language Model Group — Senior Software Developer → Principal Software Developer; Head of Group from 2019

Июнь 2018 – октябрь 2024

  • Руководил группой языковых моделей в ABBYY, которая заменила классические алгоритмы распознавания OCR и алгоритмы обработки текста нейросетевыми языковыми моделями в продуктах ABBYY.
  • Спроектировал, обучил и интегрировал в production множество нейросетевых архитектур для английского, французского и других европейских языков, а также китайского, японского и корейского, улучшив качество распознавания для всех этих языков.
  • Разрабатывал базовые слои нейронных сетей и автоматизированный pipeline обучения моделей.
  • Развивал open-source библиотеку ABBYY NeoML.

PDF Tools Development Group — Senior Software Developer, Head of Group

Май 2012 – июнь 2018

  • Начал с нуля и возглавил разработку PDF-библиотеки, лежащей в основе ABBYY FineReader и ABBYY PDF Transformer — PDF-движка, сопоставимого по масштабу с PDF-библиотекой Adobe Acrobat.
  • Реализовал чтение и запись PDF-файлов, редактирование, конвертацию в другие форматы, цифровые подписи, аннотации и интерактивное редактирование документов и многое другое.

OCR Export Group — Software Developer

Июль 2010 – май 2012

  • Реализовал экспорт результатов OCR в RTF, DOCX, ODT, PDF, TXT, CSV и XPS.

Open Source

  • ABBYY NeoML (github.com/neoml-lib/neoml) — разработал functional API и базовые слои нейронных сетей.

Преподавание

Московский физико-технический институт (МФТИ)

Преподаватель курса — «Речевые технологии и Edge ML» · 2025–2026

  • Разработал и преподавал курс для студентов магистратуры; NPS курса — выше 80.

Приглашенный преподаватель · ноябрь 2014 – июль 2015

  • Разработал и преподавал курс по форматам данных для студентов магистратуры.

Патент

Патент 8,548,241 B2Enhanced Multilayer Compression of Image Files Using OCR Systems


Образование

Московский физико-технический институт (МФТИ)
Магистр, прикладная математика — факультет инноваций и высоких технологий · 2004–2010


Языки

  • Русский — родной
  • Английский — B2