Коллективными усилиями создать детскую энциклопедию с использованием:
- методов и инструментов явного представления знания (WikiData, dbpedia)
- генеративных ИИ-моделей (DeepSeek, YandexGPT, GigaChat и др.)
- Работа выполняется в группах по 5 человек
- По итогам работы вам необходимо заполнить два раздела в этом репозитории:
- Описание и результаты вашей работы в директории
WORK(в соответствующем подразделе) - Markdown-файлы со сгенерированными текстами в директории
KIDBOOK(в соответствующем подразделе)
- Описание и результаты вашей работы в директории
- Каждая группа берёт себе одно направление из представленных ниже
- В рамках этого направления вам необходимо:
- Изучить существующие базы знаний по данной теме в WikiData, dbpedia и др.
- Фрагменты знаний можно извлекать с помощью запросов SPARQL
- Для извлечения подграфа знаний удобно использовать инструменты типа Wikidata Visualization Tool, либо SPARQL-запросы такого вида. Полезная информация есть тут
- По возможности экспортировать фрагменты графов знаний в электронном виде, для автоматического использования в процессе написания текстов
- Придумать концептуализацию и построить онтологию вашего фрагмента предметной области, результаты описать в документе
README.mdв директорииWORK. Используйте графические средства для визуализации онтологии, полезно будет использовать Markmap.js, Mermaid.js, nomnoml, PlantUML и т.д., для очень продвинутых можно использовать редактор онтологий Protégé. - Концептуализация должны содержать объекты и связи между ними, желательно помимо иерархических связей иметь также другие виды горизонтальных связей
- Концептуализация раздела должна включать в себя не менее 15 понятий (по 3 шт. на каждого члена команды)
- Сгенерировать markdown-странички для всех понятий с помощью генеративного ИИ. Это можно сделать вручную (cut-and-paste из диалогового интерфейса с языковой моделью), или программным путём через API. Можно использовать бесплатный лимит в GigaChat, или же зарегистрировать пробный аккаунт в Yandex Cloud (или запросить у преподавателя доступ) и использовать различные облачные модели (например, Qwen3-235B). Чтобы изучить, как использовать языковые модели в облаке Yandex Cloud, смотрите этот курс (разделы 1 и 2)
- В процессе генерации используйте в запросе промпт вида объясни для десятилетнего ребенка
- Список используемых понятий и страничек сохранить в файле
concepts.jsonв директорииWORK - С помощью скрипта на Python расставить в текстах перекрестные ссылки на все используемые понятия внутри вашей группы, а в идеале - и на понятия из других групп (посмотрев на файлы
concepts.json). Подумать, как быть с падежами (т.е. чтобы например расставлять ссылки во фразах типа "дети без ума от компьютерных игр"). - Интегрировать все файлы в этот репозиторий с помощью Pull Request
- Также одна группа берёт на себя обязанность мастер-координации результата. В рамках этого нужно:
- Посмотреть на все полученные результаты и попытаться проставить кросс-ссылки между разделами. Надо творчески подумать, как использовать для этого LLM или поиск по подсловам.
- Сделать общую домашнюю страничку, разместить результат на GitHub Pages
- Сделать страничку "словарь терминов" по всем разделам (+код для генерации такой странички)
Репозиторий содержит две основные папки:
- WORK - в ней содержатся все служебные материалы - артефакты с программным кодом, фрагменты графов знаний, изображения, оставшиеся по мотивам обсуждений в группах и т.д.
- WEB - раздел для финальных HTML-страничек книги. Это тот код, который затем будет оформляться как окончательная энциклопедия на GitHub Pages.
Внутри каждой папки создаются под-папки - по одной на каждую группу. Называть их рекомендуется в соответствии с тематическим разделом. Например, группа, отвечающая за развлечения, может хранить рабочие материалы в папке WORK/8.1_ entertainment, а финальные HTML-страницы размещать в WEB/8.1_ entertainment.
- Использование готовых знаний из структурированных источников (WikiData, dbpedia)
- Использование автоматической генерации текста с помощью LLM API
- Полнота модели знаний и её сложность (наличие связей разного вида)
- Полнота и подробность отчета
- Финальный текст (наличие ссылок, картинок, диаграмм и т.д.)
добавим после обсуждения группой
Вся подробная документация здесь