Введение в искусственный интеллект и машинное обучение
Ключевые тезисы:
- Искусственный интеллект (ИИ) как идея существует с древних времён, но как наука сформировался в середине XX века.
- Машинное обучение (МО) — ключевой и доминирующий раздел современного ИИ, изучающий извлечение знаний из данных.
- В основе МО лежит вероятностный подход и формула Байеса для обновления знаний о мире на основе новых данных.
- История ИИ — это череда «зим» (разочарований) и «хайпов», связанных с постоянным смещением целей (moving the goalposts) по мере достижения предыдущих (шахматы, го, тест Тьюринга).
Исторические корни ИИ
Идея создания разумных существ волновала человечество задолго до появления компьютеров.
- Античность: В древнегреческих мифах Гефест создавал роботов-андроидов (например, Талоса). Интересно, что задача Талоса по распознаванию «свой-чужой» до сих пор актуальна для компьютерного зрения.
- Средневековье:
- В иудейской традиции — големы, которые могли понимать речь, но не говорить (разделение распознавания и синтеза речи).
- Механические автоматы (Аль-Джазари, Жаке-Дро), включая первые программируемые механизмы (пишущий автоматон).
- Литература: Первые произведения об ИИ («Франкенштейн», «R.U.R.» Чапека) часто предупреждали о негативных последствиях.
Становление ИИ как науки
Формальным началом считается середина XX века с работ Алана Тьюринга и Дартмутского семинара.
- Алан Тьюринг: Предложил тест Тьюринга (1950) как критерий достижения человеческого уровня ИИ. Тест был пройден крупными языковыми моделями (LLM) лишь весной 2025 года.
- Тест изначально был «нечестным»: компьютер должен имитировать человека, а человеку не нужно себя выдавать.
- Дартмутский семинар (1956): Считается отправной точкой. Участники (Маккарти, Минский, Шеннон) сформулировали оптимистичный план по созданию машин, использующих язык, формирующих абстракции и самосовершенствующихся.
- Ранний оптимизм и «зимы» ИИ: Первые успехи (Logic Theorist, перцептрон) сменились разочарованием из-за неоправданных ожиданий и провала практических проектов (например, машинный перевод в Georgetown–IBM experiment).
Машинное обучение: ядро современного ИИ
С 1990-х годов акцент сместился на создание систем, которые обучаются на данных, а не программируются вручную.
- Определение (по Т. Митчеллу): Компьютерная программа обучается на опыте, если её качество выполнения задач улучшается с получением новых данных. Критически важна целевая функция (метрика качества).
- Общая схема: Есть данные (D), которые поступают в модель. Модель имеет параметры (θ), которые настраиваются в процессе обучения. Результат обучения — распределение вероятностей p(θ|D) (что мы узнали о параметрах после получения данных).
Типы задач машинного обучения
Обучение с учителем (Supervised Learning)
- Суть: Предсказание выходного значения
yпо входномуx. В данных есть пары (x, y) — примеры с «правильными ответами». - Цель: Построить модель, которая обобщается на новые, ранее не виденные примеры (а не просто запоминает данные).
- Подтипы:
- Классификация:
y— дискретная метка класса (котик vs собачка). - Регрессия:
y— непрерывное число (прогноз цены).
- Классификация:
- Вероятностный взгляд: Обучение условному распределению p(y|x).
Обучение без учителя (Unsupervised Learning)
- Суть: В данных есть только
x(без готовых ответовy). Задача — найти структуру или закономерности в данных. - Цель: Часто — снижение размерности, представление сложных высокоразмерных данных (например, изображений) в более компактном латентном пространстве.
- Примеры: Кластеризация, автокодировщики.
Обучение с подкреплением (Reinforcement Learning)
- Суть: Агент взаимодействует со средой, совершает действия и получает вознаграждение. Нет готового датасета, данные (опыт) накапливаются в процессе проб и ошибок.
- Цель: Научиться стратегии (политике), максимизирующей cumulative reward (суммарное вознаграждение).
- Пример: AlphaZero, обучающаяся играть в шахматы.
Вероятностная основа МО: Формула Байеса
Машинное обучение — это прикладной раздел теории вероятностей.
- Задача обучения: Перейти от правдоподобия (likelihood)
p(D|θ)(как данные порождаются моделью) к апостериорному распределению (posterior)p(θ|D)(что данные говорят нам о параметрах модели). - Формула Байеса — фундаментальное уравнение:
p(θ|D) = [ p(D|θ) * p(θ) ] / p(D)p(θ|D)— апостериор (знание после данных).p(D|θ)— правдоподобие (модель).p(θ)— априор (знание до данных).p(D)— нормировочная константа.
- Смысл: Обучение — это учёт частичной информации (данных) для обновления наших представлений о мире (параметрах модели). Оптимизация (минимизация ошибки) часто является практическим следствием работы с этой вероятностной框架.
Выводы:
- ИИ прошёл долгий путь от мифологии и механики до математически строгой науки.
- Машинное обучение — это современная парадигма ИИ, где системы не программируются, а обучаются на данных.
- Все задачи МО можно рассматривать через призму вероятностного вывода и формулы Байеса.
- Ключевая цель — не запоминание, а обобщение и способность делать выводы на новых данных.