ИИ 3 года назад и сегодня: что на самом деле произошло с момента появления ChatGPT
«Машина никогда этого не сможет» — а потом она смогла
Есть закономерность, которая не выходит у меня из головы. Умный, уважаемый человек смотрит на технологию, говорит с полной уверенностью «этого никогда не будет» — а через несколько лет это уже повседневность.
В 1997 году Пит Хат (Piet Hut) из Института перспективных исследований в Принстоне сказал New York Times об игре в го: «It may be a hundred years before a computer beats humans at Go — maybe even longer.» В марте 2016 года AlphaGo обыграл игрока мирового класса Ли Седоля со счётом 4:1. Не через сто лет. Через девятнадцать.
Дуглас Хофштадтер, один из самых блестящих умов когнитивистики, в 2018 году написал в Atlantic эссе под названием «The Shallowness of Google Translate». Он одобрительно процитировал фразу «No reasonable person thinks that a machine translation can ever achieve elegance and style.» В 2023 году, в разговоре, опубликованном в июне, тот же Хофштадтер говорил так: «I don’t think it’s interesting. I think it’s terrifying. I hate it. I think about it practically all the time, every single day.» И ещё: «It’s a very traumatic experience when some of your most core beliefs about the world start collapsing.»
Если это кажется знакомым, возможно, ты помнишь похожее из другой сферы. В 2017 году Джейми Даймон на конференции Barclays назвал биткоин мошенничеством: «It’s worse than tulip bulbs. It won’t end well. Someone is going to get killed.» В январе 2018 года он пожалел об этих словах. Уоррен Баффет в 2018 году на годовом собрании Berkshire назвал биткоин «probably rat poison squared», а Чарли Мангер назвал торговлю криптовалютой «just dementia». А Пол Кругман в 1998 году писал, что к 2005 году станет ясно: влияние интернета на экономику «no greater than the fax machine’s» — обосновывая это, среди прочего, тем, что «most people have nothing to say to each other!»
Я пишу это не для того, чтобы выглядеть умнее этих людей. Я не умнее. Я пишу это потому, что сейчас разворачивается тот же самый паттерн — и на этот раз мы можем наблюдать за этим в реальном времени. Это моя хронология этого процесса. Она намеренно устроена так, чтобы расти дальше.
Как было раньше (чтобы почувствовать разницу)
До появления ChatGPT в ноябре 2022 года «ИИ, который пишет текст» был темой для посвящённых.
GPT-3, модель, стоявшая за этим, была опубликована как препринт 28 мая 2020 года («Language Models are Few-Shot Learners»), бета-версия API запустилась 11 июня 2020 года. 175 миллиардов параметров — и контекстное окно всего в 2048 токенов, то есть несколько абзацев, больше «памяти» у неё не было. Обучение оценивается в 4,6 миллиона долларов; на одном GPU это заняло бы, по расчётам, около 355 лет.
И попасть туда было не так просто. GPT-3 находилась за списком ожидания. Лишь 18 ноября 2021 года — полтора года спустя — OpenAI сняла список ожидания и сделала API общедоступным.
Самый известный текст того периода многое говорит о реальном положении дел. 8 сентября 2020 года Guardian опубликовала написанную GPT-3 колонку: «A robot wrote this entire article. Are you scared yet, human?» Она начиналась словами «I am not a human. I am Artificial Intelligence.» и содержала фразу «I have no desire to wipe out humans.» Звучит впечатляюще — пока не прочитаешь мелкий шрифт. GPT-3 выдала восемь вариантов (их скормил студент из Беркли), а редакция склеила из них лучшие куски. Так что «entirely written by AI» — это, скажем так, щедрое округление.
Экспертное сообщество отнеслось к этому трезво. 22 августа 2020 года Гэри Маркус и Эрнест Дэвис вышли с заголовком в MIT Technology Review: «GPT-3, Bloviator: OpenAI’s language generator has no idea what it’s talking about.» В намеренно несистематической подборке тестов — авторы прямо называли её не бенчмарком — GPT-3 в бытовых рассуждениях примерно в половине случаев была явно права, в половине явно неправа. В марте 2021 года на конференции FAccT Эмили Бендер с коллегами ввели термин, который прижился: «стохастические попугаи» — машины, повторяющие словесные шаблоны, ничего при этом не понимая. Вердикт Маркуса два года спустя, в марте 2022 года: «For all its fluency, GPT-3 can neither integrate information from basic web searches nor reason about the most basic everyday phenomena.»
А изображения? 5 января 2021 года OpenAI показала DALL·E — ответвление GPT-3 с 12 миллиардами параметров, рисовавшее изображения по тексту. Низкое разрешение, часто мимо цели. Курьёз, а не инструмент.
Удержи в памяти эту картину: список ожидания, попугай, курированный текст, пикселизированный котёнок. Таким было положение дел три с половиной года назад.
Хронология
Дальше события идут плотнее. Я привожу ключевые релизы с датами — и рядом с каждым то, что они впервые сделали практически возможным. Этот список продолжает расти; я буду дополнять его по мере появления нового.
Май/июнь 2020 года — GPT-3 как препринт и бета-версия API. В собственном тесте OpenAI проверяющие правильно распознавали тексты, написанные машиной, лишь в 52% случаев — едва лучше подбрасывания монеты. Впервые: текст, который на уровне абзаца звучит по-человечески.
Январь 2021 года — DALL·E 1. Впервые: изображение из произвольного текста — но грубое и маленькое.
21 июня 2022 года — GitHub Copilot становится общедоступным, 10 долларов в месяц. Впервые: ИИ, который печатает вместе с тобой во время программирования, доступный по цене любому разработчику.
Июль/август 2022 года — прорыв в изображениях случается один за другим: DALL·E 2 (анонс 6 апреля, бета 20 июля), Midjourney (открытая бета 12 июля), Stable Diffusion (22 августа, открытый исходный код, работает локально на потребительском железе). Впервые: фотореалистичные, компонуемые изображения — а благодаря Stable Diffusion ещё и на собственном компьютере, без облака.
Конец августа / начало сентября 2022 года — изображение Джейсона Аллена, созданное в Midjourney, «Théâtre D’opéra Spatial» побеждает на ярмарке штата Колорадо (категория «цифровая обработка фотографии», приз 300 долларов). Жюри не знало, что это ИИ. Публичная дискуссия последовала в сентябре.
30 ноября 2022 года — ChatGPT, бесплатное превью на основе GPT-3.5. Миллион пользователей за пять дней, около 100 миллионов в месяц спустя два месяца. Впервые: попугай получает окно чата — и в него может войти весь мир.
14 марта 2023 года — GPT-4, мультимодальная (понимает и изображения), контекст до 32 000 токенов вместо 2048. В том же месяце Gen-2 от Runway запускается как одна из первых пригодных к использованию бета-версий текста-в-видео. Впервые: ИИ, который «видит» загруженное изображение — и первые движущиеся секунды из текста.
Октябрь 2023 года — DALL·E 3, прямо внутри ChatGPT. Впервые: изображения, которые действительно попадают в то, что ты напечатал, включая читаемый текст.
15 февраля 2024 года — OpenAI анонсирует Sora: до 60 секунд крайне реалистичного видео в 1080p из одного промпта. Впервые: видео, которое на первый взгляд можно принять за настоящее.
12 марта 2024 года — Cognition показывает Devin, «первого ИИ-инженера-программиста» с собственной оболочкой, редактором и браузером. Впервые: ИИ, который самостоятельно от начала до конца выполняет задачу по программированию.
Март/апрель 2024 года — Suno V3 (21 марта, полноценные песни с вокалом до четырёх минут, есть и бесплатно) и Udio (10 апреля, публичная бета). Впервые: готовая песня с голосом — из одного предложения.
13 мая 2024 года — GPT-4o, «омни»-модель для текста, аудио и изображений в одном. Впервые: плавное общение с машиной голосом в реальном времени.
24 февраля 2025 года — Claude Code запускается как исследовательское превью, в мае 2025 года становится общедоступным. Впервые: программирование превращается в диалог в терминале — в том числе для меня: этот сайт создан именно так.
25 марта 2025 года — OpenAI встраивает генерацию изображений прямо в GPT-4o. Вирусный тренд «в стиле Studio Ghibli» настолько перегрузил сервис, что запуск бесплатной версии пришлось отложить. Впервые: редактирование изображения в диалоге — «сделай небо теплее» — и это происходит.
20 мая 2025 года — Google Veo 3: впервые звук генерируется синхронно — диалоги, звуковые эффекты, синхронизация с губами. Veo 3.1 выходит в середине октября 2025 года. Впервые: видео, которое не просто выглядит правильно, но и звучит правильно.
7 августа 2025 года — GPT-5, которую OpenAI описывает как «команду экспертов уровня PhD в кармане».
30 сентября 2025 года — Sora 2: синхронный звук, улучшенная физика, функции «Cameo» — плюс собственное приложение в формате TikTok. Впервые: ИИ-видео как социальная сеть, а не лабораторная демонстрация.
Прочитай эти пять лет подряд — и попугай из 2020 года покажется родом из другого столетия.
О чём почти никто не думает
О ChatGPT говорят все. Об этом — слишком немногие, хотя это, возможно, бóльшая часть всей истории.
В ноябре 2020 года AlphaFold 2 выиграл конкурс CASP14 с медианным показателем около 92 GDT_TS, решив задачу, над которой биология билась пятьдесят лет: предсказание трёхмерной укладки белка по последовательности аминокислот. Это не игрушка. Укладка белков — основа понимания того, как работают болезни и как лекарства к ним «пристыковываются». С 2022 года база данных AlphaFold содержала более 200 миллионов структур, к 2024 году — более 214 миллионов, ею пользовались свыше двух миллионов исследователей из 190 стран. 8 мая 2024 года вышел AlphaFold 3, который предсказывает уже и комплексы белков, ДНК, РНК и молекул лекарств.
Признание пришло на самом высоком уровне: Нобелевская премия по химии 2024 года была присуждена — наполовину Дэвиду Бейкеру за компьютерный дизайн белков, наполовину совместно Демису Хассабису и Джону Джамперу за предсказание структур белков. Система ИИ оказалась в центре Нобелевской премии по химии.
И на белках дело не заканчивается:
- Медицина: Рентосертиб, лекарство против лёгочного заболевания ИЛФ, найденное с помощью ИИ, показало в исследовании фазы IIa с 71 пациентом в 22 центрах дозозависимое улучшение функции лёгких через двенадцать недель — опубликовано 3 июня 2025 года в Nature Medicine. В 2023 году модель глубокого обучения (совместная работа Университета Макмастера и MIT) выявила вещество абауцин против опасного больничного патогена — среди примерно 7500 отсканированных молекул.
- Материалы: GNoME от DeepMind в конце 2023 года предсказала стабильность 2,2 миллиона новых кристаллов. В тот же день A-Lab в Беркли показала, как робот с помощью машинного обучения синтезирует новые неорганические материалы за 17 дней. (Справедливости ради: обе работы с тех пор подверглись критике — многие считают число действительно новых структур у GNoME завышенным, а журналу Nature по A-Lab пришлось выпустить исправление. Прорыв реален, итоговая оценка спорна.)
- Погода: GraphCast предсказывает погоду на срок до десяти дней менее чем за минуту на одном компьютере — и оказалась точнее устоявшейся модели ECMWF по более чем 90% из 1380 проверенных показателей. GenCast в конце 2024 года добавила улучшенные траектории циклонов.
- Чистая математика: AlphaProof и AlphaGeometry 2 решили на Международной математической олимпиаде 2024 года четыре из шести задач, 28 из 42 баллов — уровень серебра, на один балл ниже золота. Одну из решённых задач из более чем 600 участников-людей полностью решили лишь пятеро. А FunSearch в конце 2023 года нашла доказуемо новое решение открытой математической проблемы — впервые языковая модель внесла настоящий, проверяемый вклад в новое знание.
Попугай, который якобы только повторяет заученное, таким образом сворачивал белки, находил лекарства и занимался математикой, которая едва ли под силу большинству людей.
Цифры
Когда я хочу понять, насколько серьёзна та или иная технология, я иду за деньгами — и за рабочими местами.
Мировые корпоративные инвестиции в ИИ достигли в 2024 году, по данным Stanford HAI, около 252 миллиардов долларов. В 2025 году они удвоились до 581,7 миллиарда. Одни только частные инвестиции подскочили на 127,5% до 344,7 миллиарда. Генеративный ИИ — часть, которая создаёт изображения, текст и видео, — вырос в 2025 году примерно на 200% до около 171 миллиарда долларов, это почти половина всех частных инвестиций в ИИ. США лидируют с 285,9 миллиарда частных инвестиций — в 23 раза больше, чем в Китае.
Использование не отстаёт: 78% организаций сообщили об использовании ИИ в 2024 году (против 55% годом ранее); McKinsey в 2025 году насчитала 88% с регулярным использованием хотя бы в одной бизнес-функции. Загвоздка — и я называю её намеренно: лишь около трети компаний масштабируют это за пределы пилотных проектов, и только меньшинство может показать измеримый эффект на прибыль. Пробуют многие, доводят до конца немногие.
А работа? Вот где болит по-настоящему. МВФ оценивает, что около 40% мировой занятости подвержены влиянию ИИ, в развитых странах — около 60%. Половина этих рабочих мест, вероятно, выиграет, другая половина — потеряет ключевые задачи. Глава МВФ Кристалина Георгиева сформулировала это так: «We are on the brink of a technological revolution that could jumpstart productivity, boost global growth and raise incomes around the world. Yet it could also replace jobs and deepen inequality.»
ВЭФ ожидает к 2030 году 170 миллионов новых рабочих мест и 92 миллиона исчезнувших — чистый прирост 78 миллионов. То есть не только потери. Быстрее всего растут специалисты по большим данным (+110%), инженеры финтеха (+95%), специалисты по ИИ/МО (+85%); сильнее всего сокращаются классические офисные профессии вроде делопроизводителей и кассиров. 39% ключевых навыков, востребованных сегодня, к 2030 году будут считаться устаревшими.
Одна деталь, которая настраивает меня на оптимизм: индекс Anthropic Economic Index в начале 2026 года проанализировал около двух миллионов диалогов с ИИ. Впервые augmentation (усиление, 52%) — когда ИИ помогает человеку в его работе — обогнал automation (автоматизацию, 45%), при которой ИИ полностью берёт задачу на себя. Чаще ассистент, чем замена. По крайней мере пока.
Тогда и сейчас — мои собственные расчёты
Теперь пойдёт конкретика, потому что именно здесь я живу. ИИ-магазин, блог — изображения для них должны откуда-то браться. Поэтому я посмотрел, чего на самом деле требует классическая рекламная фотосъёмка. Не клише, а расчёт.
Начнём с прав, потому что именно их большинство упускает из виду. За использование изображения к гонорару добавляется «байаут» (buy-out) — надбавка, ступенчатая в зависимости от охвата и длительности, «longer period, higher buyout», как формулируют это агентства. Лицензии обычно действуют от одного до пяти лет; после этого изображение использовать больше нельзя. А в США для каждого узнаваемого человека нужен model release — без него коммерческое использование попросту незаконно, независимо от того, знаменитость это или нет.
Дальше — люди на площадке. Агентство берёт 15–20% комиссии с модели и добавляет ещё одну наценку заказчику. Модная фотосессия на один день быстро складывается в приличную сумму: фотограф 1000–3500 долларов (в Нью-Йорке или Лос-Анджелесе легко 3000–8000+), модель 500–3000, студия 300–1500, причёска и макияж 400–1200, стилист 400–1800, ретушь за каждое изображение сверху. Скромная продакшн-версия обходится около 2600 долларов, средняя — около 12 700, топовая — от 25 000 до 100 000 долларов — за один день. А сам съёмочный день, как сухо замечает одна продакшн-компания, «the smallest part» (наименьшая часть): для телевизионного ролика препродакшн занимает 40–50% времени, ролик в целом требует 6–10 недель, кампания — 8–12. Кастинг, подбор локаций с разрешениями и страховкой, команда от 2 до 200 человек, погодный резерв.
Пример, который запоминается: знаменитый стилист по волосам выставил счёт за два съёмочных дня на 12 000 долларов — только за работу, без учёта дороги и агентства. Только за волосы.
А сегодня? Именно этот результат — человек, свет, место, настроение — это промпт. Секунды вместо недель. Никакого байаута, никакого истекающего лицензионного договора, никакой погоды. Этот сайт и магазин — живой пример: то, что ты видишь здесь в виде изображений, три года назад означало бы продакшн среднего пятизначного бюджета и месяц подготовки. Как создаются эти изображения, я показываю на странице об ИИ — ИИ-инструменты и есть тот набор инструментов, что стоит за этим.
Я говорю это не для того, чтобы отрицать чей-то профессионализм. Хороший фотограф, хороший стилист — это по-прежнему мастерство. Я говорю это потому, что исчез сам порог входа. То, что раньше требовало бюджета и связей, сегодня требует хорошей идеи и точной фразы.
В чём загвоздка
Чтобы это не превратилось в рекламный текст — честная часть. Государство почти не использует эти модели, и многие компании тоже — из соображений защиты данных. И это не глупо, это понятно. Тот, кто вводит чувствительные данные в чужую облачную модель, отдаёт контроль, который, возможно, не вправе отдавать. Ведомство, клиника, юридическая фирма не могут просто передавать персональные данные американскому провайдеру.
Но ответ на это не «никак», а «вот как к этому прийти». Вспомни Stable Diffusion от августа 2022 года — она с самого начала работала локально, на обычном железе, без того, чтобы хоть один байт покидал собственную машину. Именно это направление — модели, которые работают на собственном компьютере или в собственном здании, — путь для госучреждений и компаний, чувствительных к данным, не терять контроль. Технологии для этого становятся лучше и компактнее месяц за месяцем. Кто это игнорирует, лишь откладывает проблему, а не решает её.
Напоследок
Закономерность всегда одна и та же. Сначала «этого никогда не будет», потом «ну ладно, но это не считается», а потом это уже повседневность, и никто не помнит, что вообще в этом сомневался. Го. Перевод. Укладка белков. Изображения, голоса, видео со звуком. И да, в своё время — интернет и те самые «цифровые деньги», которые якобы были просто крысиным ядом.
Я не утверждаю, что знаю, чем это закончится. Этого не знает никто. Но один урок из этих трёх с половиной лет я рискну записать: это приходит быстрее, чем думает почти каждый — быстрее даже, чем думают умные люди, которые говорят «никогда».
Поэтому я продолжаю вести эту хронологию. Каждый раз, когда падает что-то, что вчера ещё называли невозможным, добавляется новая запись. Если хочешь расти вместе с этим списком — заглядывай время от времени, а если ты видел что-то, чего здесь не хватает, напиши мне через страницу контактов. Этот список не завершён. Он только начинается.
Комментарии
Войдите, чтобы комментировать, ставить лайки и сохранять. Войти →
Пока нет комментариев. Напишите первый.