Авторский архив на сайте — это не готовая рукопись. Рассказываем, как собрать тысячи публикаций, сохранить строки и строфы, проверить полноту данных и подготовить структурированные тома для дальнейшей работы над книгой.
Кто такая Тамара Степанюк
Тамара Степанюк — поэт из Минска, которая ведёт авторскую страницу на литературном портале Стихи.ру. Страница появилась 26 августа 2018 года и за несколько лет превратилась в большой творческий архив. В нём — лирические произведения о любви и семье, природе и временах года, памяти, возрасте, родном крае и повседневных переживаниях.
Тамара публиковала стихи последовательно, иногда по несколько произведений в день. Для читателя это удобная онлайн-лента. Но для подготовки книги многолетний труд автора оставался распределённым по тысячам отдельных страниц: каждое произведение нужно открыть, перенести, сохранить его композицию и поставить на правильное место в общей рукописи.
На момент выполнения проекта в архиве находилось 2 208 стихотворений, опубликованных с 2018 по 2026 год. Это не просто большой набор текстов, а творческая история автора, которую требовалось собрать бережно и без автоматического переписывания.
Задача: собрать все произведения и подготовить материалы к публикации книги
Главная задача состояла в том, чтобы превратить многолетний онлайн-архив Тамары Степанюк в полное, структурированное и редактируемое собрание. Исходные данные находились на авторской странице: профиль показывал ленту публикаций, полный список был распределён по десяткам страниц каталога, а каждое стихотворение открывалось на отдельном адресе.
Требовалось найти и собрать все произведения без выборки, исключить пропуски и повторы, сохранить заголовки и тексты, зафиксировать порядок публикаций, а затем подготовить материалы в Google Docs для последующей редакторской работы над книгой.
Подготовка к публикации означала больше, чем перенос текста. Нужно было сохранить переносы строк, пустые строки между строфами, ведущие пробелы и табуляцию, выстроить произведения по хронологии, оформить единые заголовки и начинать каждое стихотворение с новой страницы. Одновременно документы должны были оставаться удобными для корректуры, тематического отбора, перестановки разделов и будущей книжной вёрстки.
Объём оказался значительным: каталог занимал 45 страниц, а тексты находились на 2 208 отдельных страницах произведений. Всего автоматизированный процесс прошёл по 2 253 веб-страницам и подготовил три рабочих тома.
Почему большой архив нельзя обрабатывать как один текст
На малом объёме многие проблемы незаметны. Если вручную перенести пять стихотворений, легко проверить каждое глазами. Когда произведений больше двух тысяч, единичная ошибка превращается в системную: пропущенная страница означает десятки потерянных текстов, а лишний перенос строки повторяется десятки тысяч раз.
- Неполный обход. Первая страница показывала только 50 произведений. Без автоматического поиска пагинации в результат попало бы чуть больше 2% архива.
- Повторы. При переходах между страницами ссылки нужно нормализовать и проверять на уникальность.
- Кодировка. Сайт отдавал русскоязычный текст в Windows-1251, поэтому неверное декодирование могло повредить буквы и знаки.
- HTML-разметка. Визуальная строка стихотворения и технический перенос в исходном коде — не одно и то же.
- Авторские отступы. Пробелы и табуляция иногда являются частью композиции и должны сохраняться при конвертации.
- Лимиты документов. Один гигантский файл неудобен для открытия, навигации и редакторской работы.
Поэтому задача была построена не как «скачать страницу», а как конвейер: обнаружение, извлечение, нормализация, проверка, форматирование, загрузка и повторная проверка уже в целевой системе.
Как работала автоматизация
Поиск всего каталога
Алгоритм последовательно обнаружил страницы пагинации, прошёл 45 страниц списка и собрал ссылки на произведения в исходном порядке.
Сбор 2 208 уникальных ссылок
Ссылки нормализовались и дедуплицировались. Контрольная точка сравнивала количество найденных карточек с количеством уникальных адресов.
Параллельное извлечение текстов
Страницы обрабатывались ограниченными параллельными пакетами с повторными попытками при сетевых ошибках. После каждого пакета результат сохранялся, поэтому работа могла продолжиться без потери уже собранных данных.
Нормализация без переписывания автора
Из HTML извлекались заголовок, имя автора, текст, год и свидетельство. Сервисная разметка удалялась, но содержимое стихотворения не редактировалось и не «улучшалось» моделью.
Формирование рукописи
Архив выстроили по хронологии, разделили на три тома и применили единый книжный шаблон: отдельная страница для каждого произведения, центрированный заголовок и основной текст Times New Roman.
Проверка после загрузки
Готовые Google Docs выгрузили обратно в текстовый формат и программно сопоставили с источником. Проверка подтвердила наличие всех 2 208 блоков в правильном порядке.
Как сохранили форматирование стихотворений
Для обычного делового документа лишняя пустая строка — косметическая проблема. В стихотворении переносы формируют ритм и строфу, а отступ может быть авторским приёмом. Поэтому форматирование проверялось как часть данных.
В архиве оказалось 39 710 строк текста и 6 613 пустых разделителей строф. Простая замена HTML-тега переноса строки сначала давала двойной разрыв: после тега на сайте уже находился технический перевод строки. На масштабе всего архива это удваивало интервалы почти во всех произведениях. Проверка выявила закономерность, правило нормализации было исправлено, после чего все тексты собрали заново.
Отдельная проблема возникла с табуляцией и ведущими пробелами. При конвертации Word-документа в Google Docs один обычный пробел в начале строки мог исчезать, а табуляция превращалась в визуальный отступ из пробелов. Чтобы композиция не менялась, ведущие пробелы сохранялись техническими неразрывными пробелами, а проверка сравнивала визуально эквивалентные отступы.
Главный принцип: автоматизация больших объёмов информации должна проверять не только наличие записей. Она должна контролировать структуру, порядок, кодировку и результат после переноса в конечную систему.
Что получилось в цифрах
- 2 208 стихотворений без пропусков и пустых текстов.
- 45 страниц авторского каталога.
- 2 208 детальных страниц произведений.
- 2 253 страницы сайта в полном цикле обработки.
- 875 835 символов непосредственно в стихотворениях.
- 36 195 символов в заголовках.
- 912 030 символов текста и заголовков вместе.
- 39 710 строк и 6 613 разделителей строф.
- 2 208 из 2 208 произведений прошли итоговое сопоставление после загрузки в Google Docs.
Для удобства работы материалы распределили по трём документам: 1 185 произведений за 2018–2020 годы, 619 за 2021–2023 годы и 404 за 2024–2026 годы. Такое деление уменьшает нагрузку на браузер и позволяет редактору работать с периодами отдельно.
Эффект обработки большого объёма
Даже если тратить всего две минуты на открытие страницы, копирование текста и создание заголовка, перенос 2 208 произведений занял бы около 73,6 часа, или 9,2 восьмичасового рабочего дня. И это расчёт без поиска пропусков, устранения дублей, проверки кодировки, исправления разметки и повторной сверки.
Автоматизация снимает именно повторяющуюся часть: переходы по страницам, копирование полей, сортировку, создание однотипных блоков и контроль количества. Человек остаётся нужен там, где требуется издательское решение: отбор произведений, тематическая композиция, корректура, согласование прав, предисловие и финальная вёрстка.
Важный эффект проявляется не только в скорости. Программный процесс создаёт воспроизводимость. Если на сайте добавятся произведения или изменится правило оформления, архив можно обновить по тем же шагам, а не начинать ручную работу сначала.
Где ещё применим такой подход
Поэзия — наглядный пример, но архитектура решения универсальна. Подобный конвейер подходит для любых распределённых массивов, где данные нужно собрать, очистить, структурировать и подготовить к работе.
- архив договоров и приложений с разбивкой по контрагентам;
- каталоги товаров и услуг из нескольких источников;
- исторические публикации, статьи и корпоративные базы знаний;
- отчёты филиалов, анкеты, обращения и заявки клиентов;
- инструкции и техническая документация с единым шаблоном;
- перенос материалов из старой системы в Google Workspace, CRM или второй мозг компании.
Для таких задач важна связка автоматического сбора, правил качества и контрольной выгрузки. Посмотреть другие варианты можно на странице решений prompt.by. Если задача связана с регулярной обработкой документов и поручений, полезен также ИИ-ассистент руководителя.
Что автоматизация не должна решать сама
Сбор открытых публикаций не означает автоматического права на коммерческое издание. Перед выпуском книги нужно подтвердить согласие автора или правообладателя. Также алгоритм не должен самовольно исправлять пунктуацию, опечатки или авторскую графику: такие изменения относятся к редактуре и требуют отдельного согласования.
Поэтому в этом кейсе автоматизация отвечала за перенос и техническое качество, а не за литературную оценку. Исходный текст сохранялся, расхождения фиксировались, а потенциально спорные решения оставались человеку.
Частые вопросы
Можно ли собрать ещё больший архив?
Да. Ограничение обычно связано не с количеством записей, а с правилами источника, лимитами целевой системы и требуемой глубиной проверки. Большие массивы делят на устойчивые пакеты и сохраняют промежуточные результаты.
Зачем проверять данные после загрузки?
Успешный ответ API подтверждает только выполнение запроса. Конвертация может изменить пробелы, переносы или стили. Поэтому конечный документ нужно прочитать обратно и сравнить с подготовленным набором.
Можно ли добавить оглавление и тематические разделы?
Да, но это следующий редакционный этап. Сначала создаётся полный проверенный архив, затем автор или редактор определяет структуру книги, разделы и порядок произведений.
Использовался ли ИИ для переписывания стихотворений?
Нет. Тексты не генерировались и не перефразировались. Автоматизация использовалась для извлечения, нормализации, структурирования, форматирования и контроля качества.
Есть большой архив, который пора превратить в рабочую систему?
Разберём источники, правила качества и конечный формат. Начнём с пилотного набора, проверим результат и только после этого масштабируем обработку.
Обсудить задачу