---
title: Обработка аудио
questionDates:
  q-transfer-0053: '2026-10-01'
  q-transfer-0054: '2026-10-01'
seo:
  description: >-
    Тема «Обработка аудио» для собеседования Data Scientist. Как частота
    дискретизации ограничивает спектр аудиосигнала? Как подготовить аудио к
    обучению нейросети?
  title: Обработка аудио — Data Scientist
---

[Все темы Data Scientist](/prep/data-scientist)

## Как частота дискретизации ограничивает спектр аудиосигнала? [#q-transfer-0053]

При частоте дискретизации `f_s` однозначно представимы частоты ниже `f_s / 2`, частоты Найквиста. Компоненты выше этой границы отражаются в более низкие частоты и создают aliasing. Поэтому перед ADC применяют аналоговый anti-alias filter, а перед downsampling цифровой low-pass filter. Повышение sample rate расширяет доступную полосу, но увеличивает объем данных и вычисления. Частоту выбирают по полезному спектру сигнала, а не по принципу «чем больше, тем лучше».

:::note[Ссылки для изучения]

1. [Частота дискретизации, теорема Котельникова и алиасинг: примеры для аудио](https://habr.com/ru/articles/503786/)
   :::

---

## Как подготовить аудио к обучению нейросети? [#q-transfer-0054]

Сначала приводят записи к согласованным sample rate, числу каналов и амплитудному масштабу, не уничтожая полезную динамику. Затем режут на окна, строят waveform или STFT/mel-spectrogram, задают padding и маски длины. Augmentation применяют только к train: шум, сдвиг времени, изменение gain или SpecAugment должны соответствовать реальным условиям. Split делают по говорящему, устройству или сессии, чтобы почти одинаковые фрагменты не попали в разные наборы. Все параметры preprocessing версионируют.

:::note[Ссылки для изучения]

1. [Подготовка WAV для нейросети: декодирование, padding и STFT-спектрограммы в TensorFlow](https://www.tensorflow.org/tutorials/audio/simple_audio?hl=ru)
   :::
