КОНЦЕПЦИЯ
Искусственный интеллект в последние годы всё больше и больше проникает в человеческий быт, хобби и работу. Его стремительное развитие затронуло и меня: я уже около года серьезно изучаю генеративный искусственный интеллект в качестве хобби. Особенный интерес для меня представляют модели, способные работать с текстом и, в особенности, его самостоятельно создавать.
При выборе темы и подбора соответствующего датасета я руководствовалась собственным интересом к данной тематике и достаточно обширным опытом: за время своего увлечения мне удалось пообщаться и попробовать в деле достаточно большое количество моделей.
Для поиска датасета, изучающего текст нейросетей, я использовала ресурс Кaggle. На нем я нашла интересующий меня файл: сравнения текста, созданного ИИ и текста человека. На странице датасета указано:
«Он (датасет) разработан, чтобы помочь исследователям, специалистам по обработке данных и энтузиастам машинного обучения изучить, чем текст, написанный ИИ, отличается от текста, написанного человеком, с точки зрения структуры, эмоционального содержания, стиля и лингвистической сложности.»
Мне хотелось бы визуально продемонстрировать эти различия с помощью диаграмм. Для более полного анализа я использованы следующие типы:
- СТОЛБЧАТАЯ ДИАГРАММА;
- ГИСТОГРАММА;
- БОКСПЛОТ;
- СЛОЖЕННАЯ ГИСТОГРАММА;
- ВИОЛОНЧЕЛЬНЫЙ ГРАФИК.
Эти виды графиков помогут мне наглядно представить информацию, а читателю, в свою очередь, так будет легче воспринимать данные, которые будут мной описаны.
ОБРАБОТКА ДАННЫХ И ВИЗУАЛЬНЫЙ СТИЛЬ
В самом начале работы я загрузила все необходимые библиотеки и датасет в формате CSV с помощью Pandas.
ПАЛИТРА
Также я подобрала цветовую палитру в зеленых оттенках.
Зеленый цвет ассоциируется у меня с фильмом «Матрица», где искусственный интеллект был сюжетно противопоставлен человеку. Тем не менее, я сознательно сделала оттенки мягче, чтобы добавить в лонгрид больше природных мотивов, как раз-таки отделяя его от упомянутого фильма: я считаю, в конечном итоге наш мир придет к симбиозу ИИ и человеческого разума. Людской вклад здесь и отмечен приглушением тонов.
Благодаря внутренним возможностям Google Colab мне удалось применить зеленую цветовую палитру к графикам и диаграммам, которые подкрепляют исследуемые данные визуализацией.
Помимо этого, в проекте была задействована платформа Carbon Now, которая помогла мне изменить цветовую палитру кода.
Чтобы подобранная палитра отобразилась на графиках, после добавления библиотеки Pandas я добавила несколько строк, которые меняли оригинальные цвета Google Colab на те, которые были необходимы мне:
Идея с природными оттенками пришла ко мне не сразу. Прежде чем она появилась, был создан код и наименования цветов. Чтобы уделить больше времени визуализации, было принято решение не исправлять названия в уже готовом тексте, а изменить только HEX-коды оттенков. Получилась своеобразная отсылка на прошлую вариацию совсем уж «матричных» цветов проекта.
1. СТОЛБЧАТАЯ ДИАГРАММА
Найденный мной датасет оценивает текста людей и генеративного искусственного интеллекта по различным параметрам: указывается длина в словах, в символах, оценивается качество и настроение.
Помимо этих параметров, рядом с каждым из текстов, собранных в датасете, указывается тематика. Мне стало любопытно сравнить, какие темы наиболее популярны у человека и у ИИ. Для удобства названия параметров написаны в оригинале. Например HUMAN для человеческих текстов и AI для тех, что были написаны искусственным интеллектом.
Первым делом я сравнила темы, чаще всего появляющиеся в нейросетевых текстах. Так получился топ-10 наиболее частых, где можно заметить, что в датасете тематика науки занимает первое место по популярности у ИИ: тридцать шесть отрывков из рассматриваемых пятисот. Наименее частой темой в топе, занявшей последнее место, оказалась тема технологий.
Следующим шагом я сравнила темы, чаще всего появляющиеся в человеческих текстах. Был создан еще один топ-10 по аналогии с прошлым графиком. Для меня оказалось удивительным, что тема науки, у ИИ получившая первое место по популярности, появилась на 10 месте у человека. Наиболее распространенной темой оказалась тема финансов.
2. ГИСТОГРАММА
Затем меня заинтересовало значение количества символов: будут ли какие-то различия между ИИ и человеком в этом конкретном параметре.
Из опыта работы с искусственным интеллектом мне известно, что ответы нейросетей зачастую более развернутые, чем человеческие, но чаще генерируются типовым образом: подчиняются конкретной структуре и рамкам длины. Было очень любопытно проверить, насколько я окажусь права в своих суждениях.
Была создана гистограмма, где на графике наглядно показан интересующий меня параметр. Горизонтально в порядке возрастания показано количество символов. Вертикально расположено, насколько часто то или иное количество появляется в датасете. В правом верхнем углу и пунктирной линией отмечено среднее значение.
Получился интересный разброс: в левой стороне графика, где был показан ИИ, практически точное количество слов появлялось наиболее часто, один из столбцов значительно доминирует над другими. У людей напротив: есть наиболее частый диапазон, но столбцы разрозненны. График справа напоминает не закономерность, а скорее наблюдение за совпадениями.
3. БОКСПЛОТ






