Сдача звукового файла: чеклист по loudness, форматам и стемам перед релизом

мастеринг стандарты стемы продакшн

Практический гид по финализации аудиоматериалов: измерение интегральной громкости LUFS, контроль пиков, подготовка архива стемов и сдача без сюрпризов для монтажера.

Завершение работы над звуковой дорожкой — этап, на котором техническая небрежность может перечеркнуть недели кропотливого сведения. Сдача аудиофайлов заказчику, режиссеру монтажа или на стриминговую платформу требует четкого соблюдения спецификаций. Ситуации, когда файл звучит тише соседей по сетке вещания, хрипит в динамике смартфона из-за межсэмплового клиппирования или заставляет видеомонтажера вручную пересобирать дорожки без доступа к балансу — следствие отсутствия финального контроля.

Грамотная передача мастер-материалов строится вокруг трех базовых элементов: попадание в целевые стандарты громкости (Loudness), техническая гигиена формата и правильная упаковка стемов (stems).

1. Нормализация по громкости: стандарты и шкала LUFS

Ориентиры Integrated LUFS и True Peak при сдаче

Схематичный loudness-метр · иллюстрация для sound-producer.ru

Эпоха измерения громкости по показаниям классических пиковых индикаторов (Peak/RMS) давно ушла. Современное вещание и цифровые платформы опираются на стандарт измерения интегральной громкости LUFS (Loudness Units Full Scale), учитывающий особенности человеческого восприятия спектра (кривая К-взвешивания).

Попытка «разогнать» звук до максимальной плотности больше не имеет практического смысла: стриминговые сервисы и эфирные алгоритмы просто принудительно понизят уровень пережатого трека, превратив его в вялый и плоский микс без динамики.

Целевые ориентиры по платформам

  • YouTube и Web-видео: диапазон от -14 до -13 LUFS Integrated. Допустимо уходить до -12 LUFS для плотных динамичных роликов, если в звуке нет агрессивных высоких частот.
  • Подкасты и разговорные форматы: стандартная планка -16 LUFS Integrated для стерео (и -19 LUFS для чистого моно-вещания) согласно рекомендациям AES TD1004/EBU R128. Это гарантирует комфортное прослушивание в шумном транспорте без выкручивания регулятора громкости на максимум.
  • Broadcast / Телевидение (РФ и Европа): строгий стандарт EBU R128 — ровно -23 LUFS (±0.5 LU) Integrated. Превышение этого порога приведет к автоматическому отклонению материала отделом технического контроля (ОТК).
  • Стриминг музыки (Spotify, Apple Music): от -14 до -16 LUFS Integrated с сохранением естественного динамического диапазона (LRA).

Контроль True Peak

Пример измерения EBU R128 / loudness (Loudgain)

Скриншот: Software: Alessandro Ghedini and Matthias C. Hormann Screenshot: VulcanSphere — Wikimedia Commons, BSD

Никогда не выставляйте потолок пикового лимитера в 0.0 dBFS. При цифро-аналоговом преобразовании в потребительских звуковых картах или конвертации несжатого WAV в форматы со сжатием (AAC, MP3) возникают межсэмпловые пики (Intersample Peaks).

  • Всегда устанавливайте True Peak Ceiling на уровне -1.0 dBTP (для клубных и громких коммерческих треков) или -1.5...-2.0 dBTP для стриминговых платформ и подкастов. Это оставляет алгоритмам кодирования запас для интерполяции без грязи и искажений на транзиентах.

2. Форматы файлов: разрешение и разрядность

Для финальной сдачи мастер-файлов стандартом де-факто остается несжатый PCM-формат:

  • Основной мастер: WAV / Broadcast WAV (BWF)
  • Разрядность: 24-bit (32-bit float для промежуточного обмена)
  • Частота дискретизации: 48 kHz для видео и трансляций / 44.1 kHz для релизов музыки

44.1 кГц против 48 кГц

Если звук делается под видеоряд, проект изначально должен вестись и экспортироваться с частотой дискретизации 48 кГц (или кратной ей 96 кГц). Сдача файла с частотой 44.1 кГц видеомонтажеру часто приводит к скрытому пересчету внутри видеоредактора на этапе рендера видео. Некачественные встроенные алгоритмы ресемплинга могут внести в звук алиасинг и легкий рассинхрон длины дорожки на дистанции полуторачасового хронометража.

Дизеринг (Dithering)

Если проект сводился в 32-bit float или 24-bit, а финальный мастер отдается в 16-bit (например, под тиражирование Audio CD или жесткие требования вещателя), в самом конце цепочки мастеринга обязательно включается дизеринг (TPDF dither). Он подмешивает микроскопический псевдослучайный шум, маскирующий шум квантования на самых тихих затуханиях и реверберационных хвостах. При экспорте в 24 бита без смены разрядности дизеринг не требуется.

3. Подготовка стемов: правила гигиены архива

Сдача исключительно одного финального стереофайла — частый источник проблем на финальном монтаже. Если режиссеру потребуется приглушить фоновую музыку под удлинившуюся реплику ведущего, цельный файл свяжет ему руки. Профессиональный стандарт сдачи проекта под видео — комплект взаимодополняющих стемов (подгрупп).

Базовый сплит подгрупп

  • DX (Dialogue / Speech): все голоса, дикторы, синхроны с площадки, обработанные и сбалансированные между собой.
  • FX (Sound Design & Foley): звуковые эффекты, фактуры, переходы, атмосфера локаций.
  • MX (Music): вся музыкальная подложка, разбитая при необходимости на ритм-секцию и мелодические инструменты.

Жесткие правила рендера стемов

  • Общий старт (Zero Point): все файлы стемов обязаны начинаться строго с таймкода 00:00:00:00 (или первой секунды хронометража проекта). Монтажер не должен вручную двигать дорожки по слуху — они должны вставать на таймлайн в один клик.
  • Сумма равна мастеру: при сложении всех выгруженных стемов на таймлайне с единым уровнем громкости 0 дБ итоговый микс обязан звучать абсолютно идентично утвержденному стереомастеру (включая работу мастер-компрессии и сатурации). Для этого мастер-обработка либо аккуратно отключается, либо переносится на сайдчейн-управление.
  • Понятный нейминг: избегайте названий вроде Audio_final_v2_new.wav. Используйте структурированные имена: [ProjectName]_[Type]_[Format]_[Date].wav (например: Promo_DX_Stems_48k_24b.wav).

Соблюдение этих простых инженерных рамок гарантирует, что ваша работа дойдет до конечного слушателя именно в том виде, в каком она задумывалась в контрольной комнате студии.

Ориентиры по аудиопосту и сдаче материалов (Москва)

Пакет Речь / подкаст Ролик / презентация Полный аудиопост
Объём до 30 мин речи 1–3 мин ролик 10+ мин + FX
Loudness −16 / −14 LUFS по ТЗ платформы по вещательному ТЗ
Стемы мастер + dry VO / FX / музыка полная раскладка
Срок 1–2 дня 2–4 дня от 5 дней
Ориентир, ₽ 15–35 тыс. 25–60 тыс. 70–200 тыс.+

Цифры — ориентиры для Москвы (озвучка мероприятий / концертный звук / эфирный тракт); точная смета зависит от площадки, тайминга и резервов.

План Б: без чего звук на площадке превращается в лотерею

  • Два мастера: основной под ТЗ + запасной с другим потолком TP, если платформа изменит спеку.
  • Стемы всегда: речь / музыка / FX отдельно — монтажёр поправит баланс без полного ремикса.
  • Контроль на смартфоне и ноутбуке: кроме студийных мониторов.
  • Хеш/дата в имени файла и короткий README с LUFS/TP/sample rate.

Если в коммерческом предложении нет этих пунктов — вы платите не за управляемый звук, а за надежду.

FAQ: коротко по делу

Какой Loudness брать для YouTube и подкастов?

Частый ориентир около −14 LUFS (YouTube) и −16 LUFS (подкасты/речь); точное значение — только по ТЗ площадки или заказчика.

Зачем сдавать стемы, если есть мастер?

Чтобы монтажёр мог прибрать музыку под VO или заменить FX без возврата всего проекта в сведение.

Что проверить перед отправкой файла?

Integrated LUFS, True Peak, sample rate/bit depth, отсутствие DC/клиппинга, имена файлов и краткий README.

Сколько стоит сдача/мастеринг речи под ролик в Москве?

Ориентир 15–35 тыс. ₽ за речь/подкаст, 25–60 тыс. ₽ за ролик. Запрос на edisonemusic@gmail.com.

Финальная сдача проекта без сюрпризов — это признак профессионального уважения к коллегам по производственному циклу. Если вам требуется финальный мастеринг, подготовка корректного архива стемов или техническая проверка микса под требования площадки, напишите на edisonemusic@gmail.com — решим задачу четко и в срок.