← Назад к блогу

Искусственный интеллект / Машинное обучение / Генеративный ИИ / ИИ-грамотность

Что такое ИИ на самом деле? Как он учится, генерирует и ошибается

PetexSpace

Вы могли использовать искусственный интеллект несколько раз до того, как закончили завтрак. Почтовый сервис переместил подозрительное сообщение с глаз долой. Карта сравнила возможные маршруты. Камера телефона нашла лицо или растение. Музыкальный сервис переупорядочил список. Ни один из этих моментов не выглядел как машина из научной фантастики. Они выглядели как обычное программное обеспечение, принимающее небольшое решение от вашего имени.

Это одна из причин, почему ИИ может казаться сложнее для понимания, чем следовало бы. Интерфейс показывает ответ, но скрывает механизм: цель, которую кто-то выбрал, примеры, использованные для построения модели, сигналы, подаваемые на вход, и тесты, определившие, был ли результат достаточно хорош. Генеративный ИИ добавляет ещё один уровень путаницы, потому что он может объяснять себя на отполированном языке, даже когда объяснение неполно или ошибочно.

Это руководство открывает этот механизм, не делая вид, что все системы ИИ работают одинаково. Оно прослеживает один практический вопрос от начала до конца: что должно произойти, прежде чем машина сможет превратить входные данные в выходные, и что следует проверить, прежде чем доверять результату?

Полезное определение ИИ

Обновлённое определение ОЭСР описывает систему ИИ как машинную систему, которая делает выводы из своих входных данных о том, как генерировать выходные данные, такие как прогнозы, контент, рекомендации или решения, которые могут влиять на физическую или виртуальную среду. Разные системы различаются по автономности и по тому, продолжают ли они адаптироваться после развёртывания.

Важный глагол здесь - делать выводы. Традиционный калькулятор следует правилам, которые полностью определяют, как превратить числа в ответ. Модель ИИ часто справляется с ситуацией, где написание каждого правила вручную было бы непрактично. Она оценивает полезный результат на основе закономерностей, ограничений или изученных взаимосвязей. Этот результат может быть отличным, посредственным или опасно вводящим в заблуждение в зависимости от задачи и условий.

Таким образом, ИИ - это не один продукт, не один алгоритм и не цифровой разум. Это зонтичный термин, охватывающий множество систем. Спам-фильтр, распознаватель речи, предсказатель структуры белков и языковая модель - все они могут соответствовать определению, имея мало общего, кроме общей схемы «вход-модель-выход».

Каждая система ИИ - это больше, чем модель

В публичных обсуждениях модель часто рассматривается как вся машина. На практике модель - это один компонент внутри системы. Стоит разделить пять частей:

  • Цель: то, что система оптимизируется для прогнозирования, ранжирования, генерации или принятия решений.
  • Входные данные: информация, доступная в момент использования, такая как пиксели, слова, показания датчиков, местоположение или прошлое поведение.
  • Модель: изученный или сконструированный механизм, который преобразует входные данные в результат.
  • Выходные данные и интерфейс: метка, оценка, маршрут, изображение, предложение или действие, показанные человеку или переданные другой системе.
  • Оценка и обратная связь: тесты, мониторинг, исправления и человеческие решения, используемые для оценки того, работает ли система в реальных условиях.

Рассмотрим планирование маршрута. Цель может заключаться в минимизации расчётного времени в пути. Входные данные включают дорожную сеть, текущее местоположение, закрытия и сигналы светофоров. Модель оценивает стоимость возможных маршрутов. Интерфейс представляет один или несколько вариантов. Обратная связь поступает по мере изменения трафика и завершения поездок. Полезный результат получается из всей цепочки, а не из изолированного алгоритма.

Цель также заслуживает внимания. Система может оптимизировать свою назначенную цель и при этом давать результат, который людям не нравится. Маршрут, который в среднем самый быстрый, может включать напряжённый поворот. Рекомендация, оптимизированная под клики, может быть не той рекомендацией, которая оставляет человека лучше информированным. Компьютеры не обнаруживают правильную человеческую цель автоматически. Люди определяют цель, выбирают, что можно измерить, и принимают компромиссы.

Как машина учится на примерах

Предположим, дистрибьютор яблок хочет выявлять побитые фрукты по изображениям с камер. Программа, основанная на правилах, может проверять цвет и форму, используя пороговые значения, написанные инженером. Это может работать в контролируемых условиях, но настоящие яблоки различаются по сорту, спелости, освещению, углу и текстуре поверхности. Подход машинного обучения использует множество примеров и корректирует модель так, чтобы её прогнозы всё больше соответствовали известным результатам.

An apple-sorting example showing human-provided examples, model training, a test set, and classification of a new apple
A simplified learning pipeline: examples shape the model, a separate test set checks generalization, and inference handles a new case.

Во время обучения модель делает прогнозы на примерах, измеряет, насколько эти прогнозы далеки от желаемого результата, и обновляет числовые параметры, чтобы уменьшить эту ошибку. Детали различаются в разных алгоритмах, но цикл узнаваем: прогнозируй, измеряй, корректируй, повторяй. Модель не хранит словесное правило типа «каждое тёмное пятно - это синяк». Она подгоняет математическую зависимость, которая может комбинировать множество визуальных сигналов.

Обучение, валидация, тестирование и инференс

Эти термины описывают разные моменты, и их не следует смешивать в один:

  • Обучающие данные используются для корректировки параметров модели.
  • Валидационные данные помогают выбирать настройки и сравнивать версии, пока разработка ещё продолжается.
  • Тестовые данные откладываются, чтобы оценить, как выбранная модель справляется с примерами, на которых она напрямую не училась.
  • Инференс - это момент, когда обученная модель получает новый вход и выдаёт выход.

Модель, которая блестяще работает на знакомых примерах, но плохо на новых, недостаточно хорошо усвоила предполагаемую закономерность. Она могла переобучиться на несущественные детали своего обучающего набора. В Machine Learning Crash Course от Google наборы данных, обобщение, переобучение, оценка, производственные системы и справедливость рассматриваются как отдельные части практического машинного обучения именно по этой причине. Оценка на обучении сама по себе не является надёжным описанием поведения в реальном мире.

Даже хороший тест может быть слишком узким. Классификатор яблок, протестированный на одной камере и при одном освещении склада, может выйти из строя после развёртывания в других условиях. Это сдвиг распределения: условия, окружающие новые входные данные, больше не похожи на условия, представленные во время разработки. Реальным системам нужен мониторинг, потому что мир не обещает оставаться похожим на тестовый набор.

Нейронные сети и глубокое обучение без мифологии

Нейронная сеть - это модель, построенная из связанных слоёв числовых операций. Каждый слой преобразует одно представление в другое. Ранние слои в модели изображений могут реагировать на простую визуальную структуру; более поздние слои могут комбинировать эти сигналы в более специфичные для задачи закономерности. Глубокое обучение относится к нейронным сетям со многими такими слоями, обученным извлекать полезные представления из данных.

Биологическая лексика - это историческое вдохновение, а не доказательство того, что модель мыслит как человеческий мозг. Сеть может содержать миллионы или миллиарды настраиваемых параметров и при этом не иметь личного опыта, намерений или понимания в обычном человеческом смысле. Она выполняет вычисления, сформированные её архитектурой, целью обучения, данными и текущим входом.

Глубокое обучение оказалось особенно эффективным там, где исходные данные сложны, включая изображения, аудио, язык и научные структуры. Его сила сопряжена с затратами: может быть трудно объяснить, какая комбинация изученных сигналов привела к конкретному результату, и производительность может зависеть от больших наборов данных, обширных вычислений и тщательной оценки.

Что меняет генеративный ИИ

Классификатор выбирает среди определённых категорий. Генеративная модель создаёт новый материал, похожий на закономерности в её обучающем распределении. В зависимости от модели этот материал может быть текстом, изображением, аудио, видео, кодом или научной структурой. Генерация делает ИИ более творческим и разговорным, но она не устраняет лежащую в основе статистическую механику.

Большая языковая модель, или LLM, обрабатывает текст как токены. Токен может быть словом, частью слова, знаком препинания или другой маленькой единицей. Учитывая токены, уже находящиеся в контексте, модель оценивает распределение по возможным следующим токенам, выбирает один в соответствии с настройками декодирования системы, добавляет его и повторяет. В introduction to large language models от Google это предсказание последовательности описывается напрямую.

A mechanical illustration dividing a sentence into tokens and selecting the next token from several probabilities
A language model builds a response token by token. The illustration simplifies a much larger numerical process, but the sequential prediction is real.

Современные LLM обычно используют архитектуру Transformer, представленную в статье 2017 года Attention Is All You Need. Её механизм внимания позволяет модели взвешивать взаимосвязи между токенами в контексте, а не обрабатывать каждое слово как изолированный элемент. Обучение на больших коллекциях текста позволяет модели улавливать грамматику, стиль, повторяющиеся факты, паттерны рассуждений и взаимосвязи между понятиями в своих параметрах.

Это не превращает модель в обычную базу данных. Её параметры кодируют распределённые статистические взаимосвязи, а не аккуратную библиотеку исходных документов, которые она всегда может точно цитировать. Текст в подсказке и любые документы, предоставленные во время выполнения, становятся контекстом, но у контекста есть пределы. Некоторые приложения добавляют поиск, инструменты, калькуляторы или поиск документов вокруг модели. Эти дополнения могут улучшить обоснованность, но окончательный ответ всё равно может сочетать найденные доказательства с сгенерированным текстом и неподтверждёнными выводами.

Самый впечатляющий ИИ часто узкоспециализирован

Разговорные модели привлекают внимание, потому что любой может протестировать их за секунды. Но ценность ИИ не ограничивается разговором. Узко сформулированные системы могут решать задачи с более чёткими входными данными, выходными данными и критериями оценки:

  • Оптический распознаватель символов преобразует пиксели в изображении документа в редактируемые символы.
  • Модель мошенничества ранжирует транзакции для дальнейшей проверки, а не объявляет каждый помеченный случай преступлением.
  • Метеорологическая модель оценивает будущие состояния атмосферы на основе наблюдений и физической структуры.
  • Научная модель предсказывает молекулярное свойство или структуру, которую исследователи могут сравнить с экспериментами.

PetexSpace image-to-text tool от PetexSpace иллюстрирует первый вид сфокусированной задачи. Вход - изображение, желаемый выход - редактируемый текст, и результат можно напрямую проверить по источнику. Размытые фотографии, необычные макеты, рукописный текст и неправильные языковые настройки всё ещё могут снижать точность. Задача полезна отчасти потому, что успех и неудача видны.

Конкретный научный пример: AlphaFold

Белки сворачиваются в трёхмерные структуры, которые помогают определить их функцию. Экспериментальное определение структуры необходимо, но может быть медленным и трудным. В слепой оценке, известной как CASP14, система AlphaFold предсказала многие структуры белков с точностью, сопоставимой с экспериментальными структурами, и значительно превзошла другие вычислительные методы. В рецензируемой AlphaFold paper in Nature объясняются модель, оценка и её оценки достоверности.

A molecular biology researcher compares a predicted folded protein with experimental evidence and confidence colors
Specialized AI can address a narrowly defined scientific problem. Predictions still carry confidence estimates and remain part of a wider research process.

Этот пример важен по двум причинам. Во-первых, он показывает, что ИИ может внести вклад в сложную научную проблему, не имитируя чат-бота. Во-вторых, система сообщает, где её прогноз более или менее надёжен. Полезная научная модель не просто выдаёт красивую структуру. Она даёт исследователям доказательства неопределённости и результат, который можно проверить в рамках более крупного экспериментального процесса.

Почему даже способные системы ИИ терпят неудачу

Неудача - это не таинственный дефект, добавленный после настоящего интеллекта. Она следует из того, как система построена и используется. Несколько режимов отказа могут существовать одновременно.

1. Цель неполна

Измеримая цель обычно является прокси для результата, который люди на самом деле хотят. Оптимизация прокси может создавать странное поведение на границах. Модель может правильно улучшать свой показатель, упуская качества, которые никогда не были представлены в этом показателе. Человеческое суждение входит до обучения через выбор цели, а не только после возникновения ошибки.

2. В данных чего-то не хватает

Обучающие примеры отражают решения по сбору и исторические условия. Некоторые группы, среды, языки, устройства или редкие случаи могут быть плохо представлены. NIST отмечает, что вредная предвзятость может быть встроена в автоматизированные системы и может усиливаться в скорости или масштабе. Его работа по выявлению и управлению предвзятостью в ИИ подчёркивает, что предвзятость шире, чем чисто техническая проблема данных, и должна рассматриваться в масштабе всей системы.

3. Генеративная модель может создавать убедительную ложь

NIST использует термин «конфабуляция» для уверенно представленного ложного или ошибочного генеративного контента. Его профиль генеративного ИИ объясняет, что такое поведение естественным образом следует из моделей, генерирующих выходные данные, которые приближают закономерности в их обучающих данных. Предложение может быть статистически правдоподобным, не будучи фактически подтверждённым. Сфабрикованные цитаты особенно опасны, потому что они делают неподтверждённый ответ похожим на исследованный.

4. Мир меняется

Модель, оценённая вчера, завтра может столкнуться с новыми продуктами, новым языком, новым поведением или новыми враждебными тактиками. Точность - это не постоянное свойство, напечатанное на модели. Это измерение, сделанное на конкретных данных, в конкретное время, в конкретных условиях.

5. Люди могут доверять интерфейсу больше, чем доказательствам

Беглый ответ, уверенный тон или точный процент могут создать авторитет, которого не заслуживают лежащие в основе доказательства. Дизайн интерфейса может скрывать неопределённость или делать рекомендацию обязательной. Таким образом, конечный риск зависит как от поведения модели, так и от того, как людей просят использовать результат.

Сколько проверки требует результат ИИ?

Ответ должен зависеть от стоимости ошибки. Относиться к каждому использованию как к одинаково опасному непрактично. Относиться к каждому результату как к одинаково заслуживающему доверия - ещё хуже. Простая трёхзонная модель помогает.

Низкорискованное исследование

Мозговой штурм имён, изменение тона черновика, генерация практических вопросов или изучение нескольких способов организации заметок обычно имеют низкую стоимость ошибки. Вы можете напрямую проверить результат и отбросить слабые предложения. Модель полезна как источник вариантов, а не как авторитет.

Работа, требующая проверки

Резюме исследований, переводы, код, расчёты, сравнения продуктов и фактические объяснения могут сэкономить время, но ошибки могут пережить быстрое чтение. Проверяйте утверждения по первоисточникам, запускайте код, воспроизводите расчёт, сравнивайте перевод с контекстом и подтверждайте, что цитируемый материал говорит то, что утверждает ответ.

Важные решения

Медицинские, юридические, финансовые, связанные с трудоустройством, безопасностью, идентификацией и доступом решения требуют квалифицированного рассмотрения и подотчётного процесса. Ответ универсального ИИ не должен становиться единственным основанием для действия только потому, что он быстр или красноречив. В этих условиях неопределённость, апелляция, документация, конфиденциальность и последствия для затронутого человека важны не меньше, чем сырая прогностическая производительность.

A researcher checks an AI answer against a primary paper, a calculation, and an authoritative reference
Fluency is not evidence. Important outputs become useful only after their claims, sources, and calculations survive independent checks.

Процесс проверки, занимающий минуты

  1. Отделяйте факты от предложений. Предложенный план требует суждения; утверждение о законе, исследовании, цене или событии требует доказательств.
  2. Спрашивайте, откуда взялось каждое важное утверждение. Затем откройте источник, а не доверяйте тексту цитаты.
  3. Предпочитайте первичные материалы, когда это возможно: исследовательскую работу, официальную документацию, исходный набор данных, регулятора, стандарт или прямую запись.
  4. Проверьте, актуален ли источник и подтверждает ли он именно это утверждение, а не просто ту же общую тему.
  5. Воспроизведите расчёты и запустите сгенерированный код в безопасной среде с репрезентативными тестами.
  6. Сравните важный вывод с независимым источником или квалифицированным специалистом, ответственным за эту область.
  7. Если доказательства невозможно проверить, снизьте уверенность или не используйте результат для этого решения.

Документация может помочь ещё до начала работы. Научная статья о Model Cards for Model Reporting предлагает фиксировать предполагаемое использование, процедуры оценки, ограничения и производительность в соответствующих условиях. Отполированная демонстрация показывает, что модель может сделать один раз. Хорошая документация помогает выявить, где она была протестирована и где её не следует использовать.

Семь вопросов, которые стоит задать о любой системе ИИ

  1. Какой конкретный результат производит эта система?
  2. Какую цель она была создана или настроена оптимизировать?
  3. Какую информацию она получает сейчас и какой информации не хватает?
  4. Как она была протестирована на случаях, отличающихся от её обучающих примеров?
  5. Раскрывает ли она неопределённость, источники, ограничения или способ оспорить результат?
  6. Могу ли я независимо проверить результат, прежде чем действовать на его основе?
  7. Кто несёт издержки, если система ошибается?

Эти вопросы более показательны, чем вопрос о том, является ли инструмент интеллектуальным. Они переносят внимание с маркетингового ярлыка на реальную систему: её задачу, доказательства, границы и последствия.

Ментальная модель, которую стоит сохранить

ИИ - это метод преобразования входных данных в предполагаемые результаты в соответствии с целью. Машинное обучение строит это отображение на основе примеров. Глубокое обучение использует многослойные нейронные сети для изучения сложных представлений. Генеративный ИИ создаёт новый материал, а языковые модели делают это, многократно предсказывая токены из контекста. Ни один из этих механизмов не гарантирует истину, справедливость, релевантность или здравый смысл.

Замечательно не то, что машина стала человеком. А то, что тщательно разработанные математические системы могут обнаруживать полезные закономерности в масштабе, который ни один человек не смог бы проверить вручную. Ответственный ответ - ни поклонение, ни отрицание. Это любопытство со стандартами: понимать задачу, искать доказательства, уважать неопределённость и сохранять человеческую ответственность там, где последствия реальны.

Основные и технические ссылки

  • ОЭСР, Пояснительная записка к обновлённому определению системы ИИ, 2024.
  • NIST, Структура управления рисками искусственного интеллекта: Профиль генеративного искусственного интеллекта, 2024.
  • Vaswani и др., Attention Is All You Need, 2017.
  • Jumper и др., Highly accurate protein structure prediction with AlphaFold, Nature, 2021.
  • Mitchell и др., Model Cards for Model Reporting, 2019.
  • Google for Developers, Machine Learning Crash Course и Introduction to Large Language Models.