Что мы подразумеваем под ИИ
Добро пожаловать в урок, который поможет вам сформировать фундаментальное понимание того, как работают современные системы искусственного интеллекта, в частности, генеративный ИИ. К концу этого урока вы сможете:
- Отличать генеративный ИИ от систем классификации и прогнозирования, с которыми вы сталкиваетесь ежедневно.
- Понять, что свойства генеративного ИИ существуют на континууме от возможностей до ограничений.
- Ознакомиться с четырьмя ключевыми свойствами, которые мы подробно рассмотрим: Предсказание следующего токена (Next Token Prediction), Знание (Knowledge), Рабочая память (Working Memory) и Управляемость (Steerability).
Формирование ментальной модели машины
Термин «ИИ» очень широк. Система рекомендаций, предлагающая вам следующее видео, спам-фильтр в вашем почтовом ящике, модель обнаружения мошенничества, помечающая подозрительную транзакцию — все это ИИ. Однако ни одна из этих систем не является генеративной. Эти системы сортируют, ранжируют, классифицируют и прогнозируют. Они чрезвычайно полезны и постоянно работают в фоновом режиме нашей жизни, но не о них пойдет речь в этом курсе.
Что изменилось в последнее время, так это появление генеративного ИИ: систем, которые производят новый контент — текст, изображения, код, аудио — вместо того, чтобы категоризировать существующий. Генеративный ИИ создается в два этапа: предварительное обучение (pretraining), где он изучает закономерности из огромных объемов данных, и тонкая настройка (fine-tuning), где он формируется, чтобы быть безопасным, этичным и полезным.
По своей сути, генеративный ИИ — это система предсказания. Он не является ни равномерно способным, ни равномерно ненадежным, но обладает сильными и слабыми сторонами по определенным, предсказуемым осям. Чаще всего сила и слабость проистекают из одного и того же базового механизма: ИИ убедительно пишет, потому что это механизм предсказания, и галлюцинирует по той же причине. Этот курс охватывает четыре таких свойства, которые формируют то, что ИИ может и не может для вас сделать. Каждое из них находится на спектре — чем дальше вправо по спектру, тем больше вам следует проверять и компенсировать.
Четыре ключевых свойства LLM: от возможностей к ограничениям
1. Предсказание следующего токена (Next Token Prediction): Откуда берутся ответы?
Когда вы задаете вопрос Claude или любой другой большой языковой модели (LLM), важно понимать, что модель не «ищет» ответы в базе данных или в интернете. Вместо этого она генерирует текст, предсказывая наиболее вероятный следующий token (слово, часть слова или символ) на основе предыдущих tokens и обширных паттернов, которые она выучила во время предварительного обучения на огромных массивах текстовых данных. Это как очень сложный автозаполнитель, который создает целые абзацы и документы.
- Возможность: Благодаря этой способности ИИ может блестяще выполнять задачи, связанные с обобщением, переформатированием текста, объяснением распространенных концепций или созданием связного повествования. Он мастерски находит «проторенные пути» в языковых данных, создавая ответы, которые кажутся логичными и естественными.
- Ограничение: Проблема возникает, когда ИИ сталкивается с «новой территорией» или редкими паттернами. Поскольку он всегда предсказывает, что «звучит правдоподобно», а не обязательно «является правдой», он может генерировать убедительно звучащие, но фактически неверные ответы — это явление известно как «галлюцинации». Чем менее однозначна или распространена информация, тем выше риск того, что ИИ будет «выдумывать» вместо того, чтобы предоставлять точные данные.
2. Знание (Knowledge): Что на самом деле знает ИИ?
Знания LLM — это не то же самое, что человеческие знания. Модель не «понимает» мир в нашем смысле; она усвоила статистические корреляции и паттерны из данных, на которых была обучена. Эти знания «заморожены» на момент окончания обучения (training cutoff). Это означает, что модель не имеет доступа к информации, появившейся после этой даты, и не может самостоятельно «учиться» на новых событиях в реальном времени.
- Возможность: ИИ обладает обширными знаниями по часто встречающимся, недавним на момент обучения и последовательным темам. Это включает в себя мейнстримные темы, популярные языки, общеизвестные факты и широко обсуждаемые концепции. Он может быть невероятно полезен для доступа к этой обширной, но статичной базе знаний.
- Ограничение: Знания ИИ становятся менее надежными, когда речь идет о редких, нишевых, локальных или спорных темах. Любая информация, появившаяся после даты его обучения, также будет недоступна. Это означает, что для получения актуальных или специализированных данных всегда требуется внешняя проверка или предоставление этой информации модели.
3. Рабочая память (Working Memory / Context Window): На что ИИ обращает внимание прямо сейчас?
LLM обрабатывает информацию в рамках так называемого context window — это ограниченный объем текста (измеряемый в tokens), который модель может «видеть» и использовать для формирования своего следующего ответа. Все, что находится за пределами этого окна, эффективно «забывается» моделью в текущем взаимодействии. Это похоже на кратковременную память, которая постоянно обновляется.
- Возможность: Если ваш материал комфортно помещается в
context window, и вы предоставляете релевантный контекст, ИИ может очень эффективно обрабатывать информацию, поддерживать связность беседы и выполнять сложные задачи, требующие понимания всего предоставленного текста. - Ограничение: Проблемы возникают при работе с очень длинными документами или продолжительными беседами, когда объем информации превышает размер
context window. Модель может «забыть» детали, упомянутые в начале диалога или документа, если они вышли за пределы окна. Это явление иногда называют «обрывом» (the cliff), когда критически важная информация теряется, и ИИ начинает давать менее релевантные или даже ошибочные ответы.
4. Управляемость (Steerability): Насколько я контролирую ИИ?
Управляемость относится к способности пользователя направлять поведение ИИ и получать желаемый результат. LLM удивительно податливы и могут следовать инструкциям, но степень контроля не всегда абсолютна, и может существовать разрыв между вашим намерением и фактическим результатом.
- Возможность: ИИ очень хорошо справляется с короткими, конкретными и проверяемыми инструкциями, такими как «ответьте в виде таблицы», «не более 100 слов», «используйте только эти термины». Чем четче и однозначнее ваша инструкция, тем выше вероятность того, что ИИ точно ей последует.
- Ограничение: Сложности возникают при длинных цепочках рассуждений, абстрактных запросах или когда требуется высокая точность, свойственная человеку. Например, просьба «будьте творческим, но не слишком» может привести к непредсказуемым результатам. Чем более открытым, многозначным или требующим глубокого понимания контекста является запрос, тем больше вероятность того, что ИИ интерпретирует его иначе, чем вы предполагали, или «отклонится» от желаемого пути.
Калиброванное доверие: ключ к эффективному использованию ИИ
Цель этого курса — не научить вас полностью доверять ИИ или полностью ему не доверять, а развить калиброванное доверие (calibrated trust). Это означает, что вы научитесь оценивать, где ваша задача находится на каждом из этих континуумов — находитесь ли вы на хорошо изученной территории или приближаетесь к краю его возможностей. Вы будете понимать, каковы ставки, если ИИ ошибется, и какие меры предосторожности следует предпринять.
Понимание этих четырех свойств поможет вам более эффективно взаимодействовать с Claude и другими LLM, задавать более точные запросы и критически оценивать их ответы. Прежде чем мы углубимся в каждое из этих свойств, мы рассмотрим, как система ИИ вообще приобретает «личность» — почему она вежлива, услужлива, честна, почему иногда слишком легко соглашается или отказывается от определенных вещей. Этот процесс формирования оставляет отпечатки на всем, что следует далее.