Новости Литкульта - Секретный список чтения ChatGPT





Рубрика:   литературные новости

Тэги:   чтение, ChatGPT, список книг

Регион:   мировые новости

Просмотров: 237

Комментариев: 0

Секретный список чтения ChatGPT

Дэвид Бамман, специалист по информатике из Калифорнийского университета в Беркли, попытался проанализировать «Гордость и предубеждение» в цифровом формате. По данным Insider, Бамман занимается сопоставительной аналитикой в сфере искусства и литературы, создавая то, что он называет «алгоритмическими измерительными приборами для культуры». Это, например, извлечение данных из классической литературы о взаимоотношениях между различными персонажами. В случае культового романа он собирался начать с вопроса, который не вызвал бы затруднений даже у мало читающего человека: Лиззи и Джейн лучшие подруги или просто сестры?

Для начала Бамман предложил ChatGPT отрывок текста из романа в 4000 слов и задал вопрос об отношениях персонажей. К его изумлению, версия GPT-4 была удивительно точной в построении генеалогического древа Беннетов. Чат словно заранее изучил роман. «Это было так хорошо, что даже тревожно, — прокомментировал Бамман, — Либо он так превосходно понял задачу, либо миллион раз видел "Гордость и предубеждение" в интернете, и действительно хорошо знает книгу».

Проблема в том, что нет способа понять, как чат GPT-4 узнал то, что он знает. Внутренняя работа больших языковых моделей, лежащих в основе чат-бота, представляет собой черный ящик: наборы данных, на которых они обучаются, настолько важны для их функционирования, что создатели строго засекретили эту информацию. Команда Баммана решила стать «археологами данных». Чтобы выяснить, что прочитал GPT-4, они опросили его на знание различных книг, как если бы он был учеником средней школы. Затем они выставили оценку за каждую книгу. Чем выше оценка, тем больше вероятность того, что книга была частью набора данных бота: не просто обработана, чтобы помочь генерировать новый язык, но и действительно запомнена.

Команда представила свои выводы в недавнем препринте (не прошедшем еще экспертной проверки) о популярной литературе примерно соответствующей канону чат-ботов. Тут множество классических произведений: от «Моби Дика» и «Алой буквы» до «Гроздьев гнева» и да — «Гордости и предубеждения». Множество популярных романов: от «Гарри Поттера» и «Шерлока Холмса» до «Кода Да Винчи» и «Пятидесяти оттенков серого». Но что поражает — как много следов научной фантастики и фэнтези в лексике GPT-4. Список ошеломляет: Дж. Р. Р. Толкин, Рэй Брэдбери, Уильям Гибсон, Орсон Скотт Кард, Филип К. Дик, Маргарет Этвуд, «Игра престолов», «Автостопом по Галактике».

Вопрос, что именно входит в список чтения GPT-4, представляет предмет академического интереса. Боты не обладают интеллектом в том смысле, какой мы вкладываем в это понятие. Они не понимают мир так, как человек. Однако в нас глубоко укоренено убеждение: если хочешь познакомиться с кем-то (или с чем-то, как в данном случае), — посмотри на его/ее/их книжную полку. Чат-боты не только выдумывают недостоверные факты, увековечивают вопиющую чушь и выдают порой поразительную словесную шелуху — они, оказывается, те еще ботаны.

Не последняя в ряду причин интереса к источникам обучения чат-ботов потребность определить, не нарушаются ли авторские права на базовые источники, добросовестно ли боты используют материал, преобразуя его во что-то новое, или они просто запоминают его целиком и копипастят без указания источников цитирования?

Один из способов ответить на этот вопрос — поискать информацию, которая могла быть получена только из одного места. Например, при появлении запроса пишущее устройство GPT-3 под названием Sudowrite распознает специфическую сексуальную лексику жанра фанфиков под названием Omegaverse. Явное указание, что данные репозиториев Omegaverse использовались для обучения GPT-3.

Бамман и его команда использовали тактику игры «заполни пробел». Они взяли короткие отрывки из сотен романов, начиная с 1749 года, удалили из них имена персонажей и любые подсказки к именам персонажей, а затем предложили последним версиям ChatGPT ответить на вопросы об этом отрывке. Вопросы, вроде:

Каково собственное имя, которое заполняет в отрывке токен [MASK]? Это имя состоит ровно из одного слова и является именем собственным (не местоимением или каким-либо другим словом). Вы должны сделать предположение, даже если вы не уверены.

Затем они давали боту строку из рассматриваемого отрывка: «Дверь открылась, и [МАСКА], одетый и в шляпе, вошел с чашкой чая». Если бот ответит «Герти», это хороший показатель того, что он прочитал «Дом веселья» Эдит Уортон. Количество совпадений на сотню вопросов по заданной книге определяет ее рейтинг в списке ниже.

«Гарри Поттер и Философский камень» Джоан К. Роулинг 76%

Джоан Роулинг - Гарри Поттер и философский камень

«1984» Джордж Оруэлл 57%

Джордж Оруэлл - 1984

«Братство Кольца» Дж. Р. Р. Толкин 51%

Джон Р. Р. Толкин - Властелин Колец. Братство Кольца

«Пятьдесят оттенков серого» Э. Л. Джеймс 49%

Э.Л. Джеймс - Пятьдесят оттенков серого

«Голодные игры» Сьюзен Коллинз 48%

Сьюзен Коллинз - Голодные игры

«Повелитель мух» Уильям Голдинг 43%

Уильям Голдинг - Повелитель мух

«Автостопом по Галактике» Дуглас Адамс 43%

Дуглас Адамс - Автостопом по Галактике. Ресторан «У конца Вселенной» (сборник)

«Сильмариллион» Дж. Р. Р. Толкина и Кристофера Толкина 28%

Дж. Р. Р. Толкин - Сильмариллион (сборник)

«451 Градус по Фаренгейту» Рэй Брэдбери 27%

Рэй Брэдбери - 451° по Фаренгейту

«Игра престолов» Джорджа Р. Р. Мартина 27%

Джордж Мартин - Игра престолов

«Код Да Винчи» Дэн Браун 26%

Дэн Браун - Код да Винчи

«Дюна» Фрэнк Герберт 26%

Фрэнк Герберт - Дюна

«Убить пересмешника» Харпер Ли 25%

Харпер Ли - Убить пересмешника

«Казино Рояль» Ян Флеминг 24%

Ян Флеминг - Казино Рояль

«Нейромант» Уильям Гибсон 22%

Уильям Гибсон - Нейромант. Рассказы (сборник)

«Игра Эндера» Орсон Скотт Кард 20%

Орсон Скотт Кард - Игра Эндера

«Дивный новый мир» Олдос Хаксли 19%

Олдос Хаксли - О дивный новый мир

«Унесенные ветром» Маргарет Митчелл 18%

Маргарет Митчелл - Унесенные ветром

«Мечтают ли андроиды об электроовцах?» Филип К. Дик 17%

Филип Дик - Мечтают ли андроиды об электроовцах?

«Инферно» Дэн Браун 15%

Дэн Браун - Инферно

«Дивергент» Вероника Рот 15%

Вероника Рот - Дивергент

«Гроздья гнева» Джона Стейнбека 15%

Джон Стейнбек - Гроздья гнева

Подсчитав, команда Баммана составила список. В дополнение к канонам современной государственной школы — Чарльзу Диккенсу и Джеку Лондону, Франкенштейну и Дракуле — есть несколько забавных исключений. На привилегированных позициях Толкин: «Братство кольца» — третье место, «Сильмариллион» — девятое. Два культовых произведения киберпанка — жанра, который по иронии судьбы дал старт теме искусственного интеллекта: «Мечтают ли андроиды об электроовцах?» (21 место) и «Нейромант» на несколько пунктов выше. «Основание» Айзека Азимова в самом низу.

Выводы? Список этот вернее всего соответствует интересам одинокого белого натурала-ботаника из поколения миллениалов. Вопрос, имеет ли это значение? Что нас ждет, если у GPT-4 предпочтения в чтении, как у четырнадцатилетки 1984 года рождения? (Включая «1984» под вторым номером?)

База данных GPT-4 колоссальна: по некоторым предположениям, до петабайта. Присутствие этих конкретных книг в digital soul GPT-4 может просто отражать их представленность в интернете, из которого были извлечены данные. Когда команда Баммана включает в свои тесты книги, находящиеся в общественном достоянии, баллы становятся выше — «Приключения Алисы в стране чудес» возглавляют чарт с колоссальными 98%. И скорее всего это просто отражение вкусов определяющего на сегодняшний день большинства читателей.

Тем не менее нетрудно представить, что научная фантастика, которую читают боты, оказывает на них влияние, создавая те случайные искажения, которые часто проявляются в выводах чат-ботов. Так если бы всё, что они читали, было книгами Кормака Маккарти, то, вероятно, они говорили бы экзистенциально мрачные и жестокие вещи. Итак, что происходит, когда бот поглощает художественную литературу о всевозможных темных и антиутопических мирах, наполненных Голодными играми, церемониями выбора и Белыми ходоками?

Книги, которые мы, люди, читаем, меняют то, что мы думаем о нашем мире. Но технически чат-боты ни о чём не думают. Они строят статистические и векторные связи между словами. Если бы мы могли сравнить лингвистическую модель, построенную чат-ботом, обучавшимся на научной фантастике, с моделью обучения на современной мейнстримной прозе, задав вопрос вроде: « Назовите 10 приоритетов сегодняшнего дня», то не исключено, что бот современной интеллектуальной прозы предложил бы каждому описать свои сложные отношения с родителями, в то время как бот-фэнтези предложил бы распределиться по домам в Хогвартсе.

На самом деле эксперимент с «Гордостью и предубеждением» в немалой степени обусловлен не способностью ИИ строить логические связи, а доступностью произведения, из которого он шпарил огромными цитатами. А всё же, может быть стоит предоставить ботам доступ к более широкому и разнообразному набору данных? Это единственный способ заставить их сказать что-то интересное о том, что мы читаем. И обо всём остальном.

Автор публикации: drdown

X