Обновлено: сентябрь 2026
Глубокое обучение - это способ обучать программу на примерах, при котором она сама находит в данных нужные признаки. Человек не объясняет ей, что кошка - это «усы, лапы и хвост». Он показывает миллион снимков с подписями, а дальше сеть из множества слоёв разбирается сама.
Отсюда и слово «глубокое»: слоёв много, и каждый следующий работает с тем, что нашёл предыдущий.
Коротко
Искусственный интеллект - общее название области. Машинное обучение - подход внутри неё, когда программа учится на данных. Глубокое обучение (deep learning) - разновидность машинного обучения на многослойных нейронных сетях. Все чат-боты, распознавание лиц и речи, которые вы видели за последние годы, - это оно.
Дальше разберём, чем глубокое обучение отличается от обычного машинного, как оно устроено без формул, во что обходится по железу и в каких случаях компании оно не нужно вовсе.
Половина путаницы вокруг темы возникает из-за того, что четыре термина используют как синонимы. Они вложены друг в друга, как матрёшки, и каждый следующий уже предыдущего.
| Термин | Что это | Пример |
|---|---|---|
| Искусственный интеллект (ИИ, AI) | Вся область: любые попытки заставить программу решать задачи, которые считались человеческими | От шахматного движка на жёстких правилах до ChatGPT |
| Машинное обучение (ML) | Подход внутри ИИ: программу не программируют вручную, а обучают на данных | Фильтр спама, который учится на письмах, помеченных как спам |
| Глубокое обучение (DL) | Разновидность ML на нейросетях с большим числом слоёв | Распознавание лиц, перевод текста, генерация изображений |
| Нейронная сеть | Математическая конструкция, на которой оно и работает | Свёрточная сеть для картинок, трансформер для текста |
| Большая языковая модель (LLM) | Частный случай: очень большая нейросеть, обученная на текстах | GPT, Qwen, DeepSeek, YandexGPT |
Важная деталь: ИИ бывает и без обучения вообще. Экспертная система из девяностых с тысячей прописанных правил - тоже ИИ, хотя она ничему не училась. И наоборот, машинное обучение бывает без нейросетей: градиентный бустинг на табличных данных до сих пор обыгрывает нейросети в задачах вроде скоринга или прогноза спроса.
Разница в одном: кто придумывает признаки.
В классическом машинном обучении это делает человек. Допустим, нужно отличать нормальные логи сервера от подозрительных. Инженер садится и решает, на что смотреть: частота записей в минуту, доля ошибок, длина строки, время суток. Он собирает таблицу с этими колонками и скармливает её алгоритму. Алгоритм ищет закономерности в тех признаках, которые ему дали. Не дали колонку с адресом источника - закономерность по адресам он не найдёт, хоть бы она там и была.
В глубоком обучении признаки выделяет сама сеть. Ей подают сырые данные: пиксели, звуковую волну, текст как есть. Первый слой находит что-то совсем простое - перепады яркости, границы. Второй складывает границы в углы и дуги. Третий - в фрагменты, похожие на глаз или колесо. К десятому слою сеть оперирует признаками, которые человек не сформулировал бы словами, но которые работают.
| Классическое машинное обучение | Глубокое обучение | |
|---|---|---|
| Признаки придумывает | Человек | Сама модель |
| Тип данных | Таблицы, структурированные данные | Картинки, звук, текст, видео |
| Сколько нужно примеров | От тысяч | Обычно от десятков тысяч, чаще - миллионы |
| Железо | Хватает процессора | Нужен GPU, иногда несколько |
| Можно ли понять решение | Часто да | Почти никогда |
| Когда лучше | Табличные данные, мало примеров, нужна объяснимость | Сырые данные сложной структуры, примеров много |
Из таблицы видно главное: старый подход никуда не делся. Нейросети закрыли то, что ему не давалось. На таблице из тридцати колонок и пяти тысяч строк бустинг обучится за минуту на ноутбуке и обыграет нейросеть. А вот распознать речь в шумном цеху, кроме нейросети, некому.
Частая ошибка
«Раз глубокое обучение мощнее, начнём сразу с него». Так делают - и упираются в то, что данных для обучения нет, разметки нет, GPU нет, а задача решалась бы обычной регрессией за два дня. Порядок правильнее обратный: сначала проверить, не хватит ли простого метода.
Нейронная сеть - это набор слоёв, внутри каждого слоя сидят числа, которые называют весами. Данные проходят слой за слоем, на каждом умножаются на веса и складываются, на выходе получается ответ. В самом начале веса случайные, поэтому и ответ случайный.
Обучение идёт так. Сети показывают пример с известным правильным ответом. Она выдаёт свой. Разницу между её ответом и правильным считают числом - это и есть ошибка. Дальше алгоритм проходит по сети в обратном направлении и чуть-чуть подкручивает каждый вес в ту сторону, которая эту ошибку уменьшает. Потом следующий пример. И так миллионы раз.
Метод придумали не вчера. Обратное распространение ошибки в том виде, в каком им пользуются сейчас, описали в 1986 году Румельхарт, Хинтон и Уильямс. А перцептрон Розенблатта, первая обучаемая нейросеть, - вообще 1958 год. Идеи пролежали в столе десятилетиями по одной причине - считать их было не на чем.
Перелом случился в 2012 году на конкурсе ImageNet. Сеть AlexNet, обученная на игровых видеокартах, показала долю ошибок 15,3% против 26,2% у занявшего второе место решения на классических методах. Отрыв в десять с лишним процентных пунктов по меркам конкурса выглядел неприлично большим. После этого в тему пошли деньги, а видеокарты из игровой железки превратились в вычислительный инструмент.
Второй перелом - 2017 год и архитектура «трансформер». Она сделала обучение параллельным, и на сеть стало возможно подавать тексты совсем другого объёма. Через несколько лет из этого выросли языковые модели, которыми сегодня пользуются все.
Вот что обычно пропускают в таких статьях, а зря: у модели есть два совершенно разных режима работы, и требования к железу у них отличаются на порядки.
Обучение - это тот самый процесс с миллионами примеров и подкручиванием весов. Считается он заранее, на большом массиве данных, длится от часов до месяцев и требует держать в памяти всю модель, промежуточные вычисления и градиенты. Обучение большой языковой модели с нуля - история про сотни видеокарт и бюджет, которого нет ни у одной компании российского среднего бизнеса.
Инференс - это использование уже обученной модели. Ей подают запрос, она выдаёт ответ. Веса не меняются, память нужна в основном под саму модель. Модель среднего размера отвечает с одной-двух карт, совсем небольшая уместится и на процессоре - просто медленно. А вот тяжёлая модель на десятки миллиардов параметров упрётся в объём видеопамяти, и тут снова нужен счёт.
Практический вывод: почти никому не нужно обучать модель с нуля. Реальная работа делится на три сценария, и они сильно разные по цене.
| Сценарий | Что делают | Сколько нужно своих данных | Железо |
|---|---|---|---|
| Взять готовую и запустить | Скачивают открытую модель с весами и поднимают на своём сервере | Нисколько | Инференс: от одной карты |
| Дообучить под себя (fine-tuning) | Берут обученную модель и доучивают на своих примерах | От сотен до нескольких тысяч | Одна-две карты, часы-дни работы |
| Обучить с нуля | Собирают датасет и учат модель с чистого листа | Сотни тысяч и больше | Кластер, недели-месяцы |
Первые два сценария закрывают почти все задачи бизнеса. Третий оправдан, когда задача уникальна и похожих моделей просто нет, - для большинства компаний это не тот случай.
Когда вам говорят «нам нужен сервер под ИИ», первый вопрос должен быть про режим. Под инференс и под обучение это разные машины и разные деньги. Что из этого во что выливается по конфигурациям, мы разбирали в статье про серверы для ИИ, а отдельно про запуск языковых моделей внутри компании - в материале про сервер для локальной LLM.
Технология давно вышла из лабораторий и работает в местах, где её не замечают.
Самая заметная часть - языковые модели. Чат-боты, разбор и пересказ документов, помощники для программистов. Часть компаний работает с ними через облако, часть поднимает модель у себя: когда через неё проходят договоры и переписка, отдавать это наружу мало кому хочется.
Компьютерное зрение работает тише, но шире. Лица и номера на проходной, контроль касок на стройке, поиск дефектов на конвейере, подсчёт посетителей в торговом зале. Старые методы распознавания здесь вытеснены полностью. Рядом - речь: расшифровка звонков в колл-центре, голосовые меню, синтез.
Дальше идёт то, что видно только изнутри бизнеса. Рекомендации в интернет-магазине. Антифрод, который притормаживает подозрительную транзакцию. Прогноз отказа оборудования по вибрации, температуре и телеметрии - тема, кстати, живая и для серверных: по логам и показаниям датчиков деградацию дисков можно поймать до того, как массив развалится.
Для сравнения - чем хвастались десять лет назад. В 2014 году система распознавания лиц DeepFace считалась прорывом: девятислойная сеть на 120 миллионов параметров, обученная на четырёх миллионах фотографий, давала 97,35% точности на эталонном наборе LFW. Работу обсуждали всерьёз, до человеческого уровня оставались доли процента. Сегодня сопоставимую задачу решают модели, которые запускаются на одной карте в стойке у заказчика.
И про путаницу в названиях, раз уж речь зашла. DeepFace - это система распознавания лиц. Дипфейки (deepfake) - подмена лица на видео, другая задача и другие модели. Слова похожи, смысл разный.
Честный разговор про ограничения - единственный способ не влететь в проект, который не взлетит.
Ему нужны данные, и много. Причём размеченные. Если у вас пятьсот фотографий дефектов и никто их не подписывал, проект начинается не с выбора модели, а с полугода работы по сбору и разметке. Эту часть бюджета забывают чаще всего.
Решение нельзя объяснить. Модель выдала «отказать в кредите» или «этот сварной шов бракованный» - и не может сказать почему. В задачах, где решение придётся защищать перед проверяющим, судом или клиентом, это дисквалифицирующее свойство. Именно поэтому в банках и медицине классические методы никуда не делись.
Модель уверенно ошибается. Языковая модель выдумывает факты и делает это тем же ровным тоном, что и правду. Сеть компьютерного зрения спокойно опознаёт объект на снимке, которого там нет. Проверять ответы всё равно должен человек.
Её можно обмануть. Состязательные атаки - отдельное направление исследований: точечно изменённая картинка, для человека неотличимая от исходной, заставляет модель выдать нужный атакующему ответ. Через обучающие данные модель можно и отравить.
Она стареет вместе с данными. Модель, обученная на данных позапрошлого года, постепенно расходится с реальностью. Дообучение придётся закладывать в регламент, а не считать разовой работой.
Она стоит денег. Не столько само железо, сколько люди, которые умеют с этим работать, и время на подготовку данных.
Отдельно стоит сказать про формулировку, которая иногда встречается даже в серьёзных текстах: «недостатков у технической реализации нет». Недостатки есть, и список выше - далеко не полный.
Прежде чем закладывать бюджет, задайте себе три вопроса.
Формулируется ли задача правилами? Если условие звучит как «сумма больше X и контрагент из списка Y - на проверку», обучать нечего. Обычный код отработает быстрее, дешевле и предсказуемее, а главное - его поведение можно объяснить.
Данные табличные и их немного? Тридцать колонок и несколько тысяч строк - территория классического машинного обучения. Оно обучится на процессоре за минуты, и решение получится разобрать.
Нет ли готового сервиса? Распознавание документов, расшифровка звонков, перевод продаются по подписке уже давно. Своя инфраструктура выигрывает в трёх случаях: данные нельзя выпускать наружу, объём запросов такой, что подписка выходит дороже железа, или работать нужно без интернета. Всё остальное дешевле арендовать.
Если после всего написанного задача всё ещё выглядит подходящей, порядок действий примерно такой.
Про сам подбор железа мы писали подробно: чем графический процессор отличается от центрального и почему для этих задач берут именно его - в статье CPU и GPU: в чём разница. А как это выглядит в собранном виде, с замерами на реальной модели, показано в разборе сборки для нейросетей в корпусе Tower.
Почти. Нейронная сеть - это конструкция, глубокое обучение - способ её обучать, когда слоёв много. Неглубокие сети с одним-двумя слоями существуют, но так их сегодня почти никто не называет.
В машинном обучении признаки для анализа задаёт человек, в глубоком модель находит их сама. Отсюда и остальные различия: глубокому нужно больше данных и мощный GPU, зато оно справляется с картинками, звуком и текстом.
Для обучения - да, без вариантов. Для запуска готовой модели зависит от размера: небольшая модель пойдёт и на процессоре, просто медленно. Сравнивать стоит не наличие карты как таковое, а требуемую скорость ответа с тем, что вы получите.
Можно, если не с нуля. Дообучение готовой модели на своих данных работает и на паре тысяч примеров - этим и пользуется большинство компаний.
Компьютерное зрение на производстве и в безопасности, обработка документов и звонков, рекомендации и антифрод. Языковые модели внутри компании - самый быстрорастущий сценарий за последние пару лет.
Подберём железо под вашу задачу
Конфигурация сервера для ИИ зависит от режима работы и размера модели, а не от строчки в прайсе. Расскажите, что планируете запускать, - подскажем, какой конфигурации хватит и на чём не стоит экономить. Соберём и протестируем машину перед отгрузкой, с гарантией и поддержкой после продажи. На рынке серверов 11+ лет.
Сервер для обучения ИИ · +7 (800) 551-80-12 · info@ittelo.ru