Цифровое источниковедение - специфические проблемы
1. Вступление
Массовое внедрение цифровых технологий дало историкам не только новые возможности для работы с источниками, но и новые проблемы.
Часть этих проблем связанных с цифровыми источниками является обычными источниковедческими проблемами многократно усиленными новыми технологиями и возможностями по распространению информации.
Однако, есть и такие, которые возникли как следствие особенностей цифровых технологий и принципов функционирования Интернет. Это не только проблемы, связанные с техническими особенностями хранения, передачи и обработки данных, но и проблемы, вызванные непониманием того, по каким социальным законам живёт Интернет.
Дело в том, что не существует никакого обособленного Интернета для историков. И даже специализированные интернет-ресурсы живут по принципам обычного гражданского Интернета. То есть — среды используемой для зарабатывания денег, развлечений и зарабатывание денег на развлечениях. Технические решения, деловые подходы, навыки специалистов и привычки пользователей возникли и формировались в условиях среды, нацеленной на зарабатывание денег и развлечения.
И речь не о каком-то философском конфликте между теми, кто «борется за Истину» и теми, кто «сделает всё ради Денег». А о том, что гражданский Интернет не предназначен и, как следствие, не приспособлен, для решения задач по сохранению исторических источников и корректной работе с ними.
И хотя Интернет и дал историкам очень большие возможности для проведения исследований, он же дал им и специфические проблемы, связанные с цифровыми источниками и цифровым источниковедением.
Данная книга является структурированным сборником таких проблем с конкретными примерами и рекомендациями по способам решения.
Используемые примеры взяты как из практики самого автора, так и являются результатом наблюдения автора за тем, что происходило в Интернете за последнюю четверть века.
Хочется надеяться, что данная книга будет полезна и тем кто проводит исследования прошлого, и тем кто занимается изучением настоящего.
1.1 Об авторе
Здравствуйте, меня зовут Михаил Елисейкин.
Я принадлежу к двум мирам: в одном я создаю и продвигаю веб-сайты (с 8 августа 1998 года), а в другом — изучаю историю бензопил (с 3 ноября 2003 года).
И прежде чем написать предыдущее предложение, мне пришлось провести небольшое историческое исследование, для подтверждения указанных в нём дат.
Первая дата подтверждается записью, сделанной мной в интернет-дневнике в 2004 году, в которой я ссылаюсь на наличие у меня чека о покупке книги по JavaScript. И не смотря на то, что я помнил о существовании этой записи и знал где её искать, мне понадобилось некоторое время для того, чтобы найти её.
Вторая — хоть и взята из моей памяти, но подтверждена исследованием сделанным мной же в 2014 году, когда я понял что большая часть независимых источников подтверждающих эту дату перестала существовать.
И оглядываясь на эти годы, я вижу не только успешные исследования, но и утраченные источники. Источники которые я почему-то не сохранил, сохранил неправильно или сохранил, но не смог сберечь сохранённую копию. Источники, о существовании которых я помню, но которые уже не могу найти.
За многими примерами из этой книги стоят события из моей жизни. Мои успехи, мои провалы, мои разочарования.
Но обо всём этом я постараюсь рассказать сухо и просто, поэтому…
Здравствуйте, меня зовут Михаил Елисейкин и я историк техники.
Кроме государственных архивов с данными предприятий, мне приходится работать с прессой, технической литературой, маркетинговыми материалами производителей, художественной литературой, личными воспоминаниями и многим другим. Вобщем, со всем тем что сейчас переместилось в Интернет.
В данной книге я постарался собрать основные проблемы, с которыми я сталкивался при работе с цифровыми источниками.
Напоминаю, что эта книга подвержена многим указанным в ней рискам, связанным с источниками, начиная с ошибок автора и кончая цифровым износом.
К счастью, первое можно исправить. И если я в чём-то ошибся, сказал что-то неправильное или не сказал чего-то нужного, то не стесняйтесь мне об этом сообщить.
1.2 Обращение к IT-специалистам
Коллеги, здесь я постарался рассказать историкам о том, с какими рисками они могут встретиться при работе с цифровыми источниками и как избегать таких встреч. Тут будут простые примеры с минимумом рассказов о форматах, протоколах и других низкоуровневых подробностей.
Основной аудиторией данной книги являются люди, являющиеся профессионалами в вопросах исторических исследований, архивном и библиотечном деле и т. п.
Они специалисты в своей предметной области и знают очень много сложных, умных и непонятных вам слов. У них достаточно своих сложностей в работе и им не нужны все ваши технические знания и навыки.
Не нужно пытаться сделать из этих людей технарей, умеющих читать код бинарных файлов, допиливать старые утилиты, удалённые из официальных репозиториев и подменять http-заголовки.
Я надеюсь, что после прочтения моей книги, они просто будут понимать, что происходит и знать к кому и с каким вопросом обратиться. И когда это произойдёт — вы сами сможете проявить свои знания и навыки по работе с форматами, протоколами и прочим айтишным вуду.
Но если вы заметите, что я совсем уж сильно накосячил, то сообщите мне об этом.
Заранее спасибо.
1.3 Обращение к историкам
Коллеги, надеюсь что данный текст дошёл до вас целиком и в достаточном для чтения качестве.
Возможно, из вашего 2120 года примеры из данной книги выглядят дико и неправдоподобно, но всё это правда — родившись в аналоговую эпоху, мы слишком оптимистично встретили приход цифровых технологий, не представляя чем это обернётся.
Да, мы были наивными и глупыми, но ведь не только же. Ещё мы были жадными и беспечными. Мы вообще были очень талантливые и разносторонне развитые в вопросах делания неправдоподобных дикостей.
Правда, когда я изучаю источники 1920 года, то очень хорошо вас понимаю. (Надеюсь, что до вас дошли источники 1920 года.)
Но давайте признаем честно, что мы в своём 2020 точно такие же как они в своём 1920 и вы в своём 2120. И те, которые живут в 2220 от вас тоже не в восторге.
Однако, если вы всё же это читаете, то значит мы оказались не так уж плохи и смогли хоть что-то сохранить и передать.
Если же вы заметили в этой книге какие-то ошибки и неточности, то ваши претензии не принимаются.
Во-первых, потому что я очевидец и мне видней.
Во-вторых, потому что я не знаю кто и как поработал над этой книгой за прошедшие 100 лет.
В третьих, потому что прошло 100 лет, а Вулканская Академия Наук считает что путешествия во времени невозможны, ЕВПОЧЯ.
2. Возникновение недостоверных источников
В самом факте возникновения недостоверных источников нет ничего такого, что делало бы это явление присущим исключительно цифровым источникам.
Любой письменный источник который мы изучаем может содержать недостоверную информацию.
Автор мог просто перепутать звук работы двигателя танка со звуком работы двигателя трактора, а звук артиллерийской стрельбы с раскатами грома.
Автор мог очень сильно ждать какого-то события или результата и выдать желаемое за действительное.
И, конечно же, автор мог сознательно лгать — ради денег, ради победы в войне, ради повышения собственного социального статуса и по многим другим причинам.
Однако, в большинстве случаев эти события происходили в рамках взаимодействия «автор-читатель» и это позволяет предположить где, по каким причинам и какая именно недостоверная информация возникла.
Общаясь с продавцом смартфонов, мы представляем какие характеристики товара он может и скрывать или выпячивать.
Слушая ярого сторонника апокалиптической идеологии, мы по другому относимся к его свидетельствам о приближающемся Конце света.
Сталкиваясь с детскими воспоминаниями человека о высоких деревьях мы сделаем поправку на его рост в описываемое им время.
То есть, работая с источниками, мы не просто можем, а должны делать поправку на время создания источника, тип/жанр документа, личность его автора и задачи решаемые этим автором.
Развитие Интернета и использование цифровых технологий многократно усилило эти явления. И это создаёт значительные сложности как для историков исследующих прошлое, так и для тех, кто использует Интернет для поиска актуальной информации.
Однако, помимо усиления прежних проблем, возникли новые специфические явления приводящие к появлению не просто недостоверной, а заведомо бессмысленной информации.
И главная причина тут кроется не в самих технологиях, а в том как эти технологии изменили поведение потребителей и поставщиков товаров и услуг.
2.1 Дёшевый и бессмысленный контент
Если вы не имеете никакого отношения к созданию и продвижению веб-сайтов или к какой-то другой разновидности интернет-маркетинга, следующее утверждение может показаться вам странным. Возможно, вы даже решите, что для донесения своей мысли я довёл идею до абсурда.
Нет, я просто сообщаю факт очевидный большинству людей связанных с ведением бизнеса в Интернет:
Значительная часть того, что вы видите в Интернете не предполагает наличия смысла.
Было бы очень хорошо, если бы эту информацию сообщали не только студентам историко-архивных ВУЗов, а доносили всем учащимся в средней школе.
Суть данного явления состоит в том, что общение «автора» и «читателя» происходит при посредничестве различных сервисов: поисковых систем, социальных сетей и т. п. На первый взгляд это напоминает цепочку «производитель-продавец-покупатель», в которой производитель убеждает продавца предлагать его товар покупателям, но есть существенное отличие.
Дело в том, что общение «производитель-продавец» и «продавец-покупатель» происходят отдельно друг от друга и покупатель не видит того какие условия производитель и продавец выставляют друг-другу. И даже если покупатели видят оптовые цены, по которым продавец покупает товар у производителя, или понимают что производитель предлагает продавцам дополнительную премию за продажу именно их товара, даже в этом случае условия при общении «производитель-продавец» и «продавец-покупатель» различаются.
Однако, в Интернете происходят специфические процессы, обусловленные принципами, на которых работают сервисы-посредники.
Упрощённо данная ситуация выглядит следующим образом:
1. покупатель приходит в поисковую систему и вводит свой запрос
2. поисковая система анализирует страницы разных веб-сайтов, подбирает наиболее соответствующие этому запросу и показывает покупателю
3. покупатель переходит на один из них
4. покупатель видит страницу сайта продавца и принимает решение о покупке
Главным отличием данной ситуации от традиционной торговли состоит в том, при традиционной торговле продавец убеждает покупателя не теми же самыми словами, которые он слышит от производителя. А в нашем случаев в п.2 и п.4 используется один и тот же текст на сайте продавца.
Проблема в том, что если не случится п.2, то у продавца нет никакого шанса на п.4. Из чего следует, что текст на сайте в первую очередь предназначен для влияния на поисковые системы, а взаимодействие с покупателем отходит на второй план.
На практике это приводит к тому, что если владелец веб-сайта хочет получать от поисковой системы посетителей, он должен разместить у себя на сайте некоторое количество слов размещённых в нужном порядке. На первый взгляд это ничем не отличается от работы писателя пытающегося донести до читателей некий смысла. Но в случае с поисковыми системами речь о смысле не идёт. Специалист по составлению текстов для манипуляции поисковыми системами должен составить слова в порядке, необходимом для решения технической задачи.
Именно поэтому, в названии данной главы использовано слово «контент» (от англ. content - наполнение), а не «статья», «новость», «описание» и другие термины предполагающие наличие смысла — при решении задачи по продвижению веб-сайта в поисковых системах надо просто наполнить веб-сайт некоторым количеством слов, расположенных в нужном порядке.
Этот простой и очевидный факт с трудом воспринимается людьми не связанными с созданием и продвижением веб-сайтов.
Я часто сталкиваюсь с проявлениями такого непонимания. И в качестве яркого примера могу привести общение в facebook-сообществе «рыдактор», где люди обменивались примерами найденных ими ошибок и несуразностей в текстах. Время от времени там появлялись примеры текстов созданных по описанным в данной главе принципам и участники сообщества высказывали своё мнение о найденных ошибках и профессионализме авторов этих текстов. Иногда я спрашивал, понимает ли автор находки что именно за текст ему попался, иногда пытался объяснить с чем человек столкнулся, и очень часто я сталкивался с непониманием.
Как показывает практика, сама идея существования текстов не предполагающих смысла выглядит абсурдной. Но такова новая реальность, возникшая в следствии развития Интернета и поисковых систем.
Это не ложь, не пропаганда, не реклама, не заблуждение, не ошибка или другие явления в результате которых вольно или невольно искажается смысл, а простое решение технической задачи по созданию «контента» для сайта.
И хотя в Интернете много прекрасных веб-сайтов, с качественными и осмысленными статьями, но так же в нём много веб-сайтов наполненных текстами не предполагающими наличие смысла.
В самом дешёвом варианте речь идёт о простой механической замене слов в каком-то тексте на синонимы или составлении текста из кусков нескольких текстов, и такие тексты можно будет легко опознать. Однако, если написать в задании «текст должен соответствовать правилам русского языка» (да, индустрия создания текстов для веб-сайтов начинается с уровня, где текст может состоять из набора несвязанных друг с другом слов), то может получиться текст выглядящий как настоящий.
Таким образом, при работе с источниками в Интернете, надо отдавать себе отчёт в том, что если вы переходите по ссылке в результатах поиска в Google или Яндекс, то велика вероятность того, что вы имеете дело с текстом «идентичном натуральному» - бессмысленным, высокотехнологичным, состоящим из слов продуктом, успешно исполнившим своё предназначение.
Как историк и исследователь, я с восторгом смотрю на огромное многообразие веб-сайтов по разным темам и с готовностью пользуюсь этой великолепной возможностью для поиска источников.
Как профессионал в деле создания и продвижения веб-сайтов, я с ужасом понимаю, что могу не отличить источник, несущий в себе хоть какой-то смысл, от «контента», в задании на создание которого не было прописано уточнение «текст должен быть осмысленным».
И единственный совет, который я могу дать в данной ситуации, состоит в том чтобы пользоваться качественными веб-сайтами и стараться перепроверять найденную информацию.
Но прежде чем вы воспользуетесь этим советом, прочитайте эту книгу до конца. Из неё вы узнаете почему этот мой совет не поможет.
3. Искажение для улучшения
(раздел в процессе наполнения)
4. Цифровой износ
С наступлением эпохи цифровых технологий возникло мнение, что цифровые документы не подвержены явлению износа. Цифровые документы не выцветают, не мнутся и могут быть скопированы и переданы бесконечное количество раз без утраты собственных свойств.
По состоянию на 2020 год можно точно сказать, что это мнение не просто ошибочное, но и опасное — не понимая проблемы мы оказались неспособны бороться с её негативными проявлениями.
Но прежде чем рассказать о явлении названном мной «цифровой износ»[1], необходимо определиться с самим термином.
Речь в данном случае идёт не о техническом износе, как процессе истирания трущихся деталей, а об износе как экономическом явлении.
Большая Российская Энциклопедия даёт следующее определение [2]:
-------------
ИЗНО́Св экономике, объективно растущая потеря физич. качеств долгосрочных материальных производств. активов (основных фондов) в результате их эксплуатации и временнóго фактора и/или потери потребительных свойств вследствие появления более совершенных аналогов. Различают И. физич. и моральный.
Физический И. выражается в снижении производительности (работоспособности) из-за утраты первоначальных качеств и свойств материалов, постепенного разрушения конструкций, влияния внешних (прежде всего климатических) условий.
Моральный И. связан с последовательным отставанием ранее созданных средств произ-ва от совр. технич. уровня (моральное старение).
И. основных фондов определяется исходя из норм амортизации на полное восстановление машин, оборудования, зданий, сооружений и пр.
-------------
Применимость морального износа к цифровым документам не вызывает сомнения — технологии создания цифровых фотографий, сканов документов, компьютерной графики в играх и фильмах значительно продвинулись по сравнению с тем что было в начале цифровой эпохи. Многие из цифровых документов созданных 30, 20 и даже 10 лет назад не может сравниться с современными. Они отстали. Они морально устарели. Они — подверглись моральному износу.
На первый взгляд, вариант физического износа не применим к цифровым документам.
Аналоговые исторические источники были неотделимы от своего физического носителя: чернила и краски выцветали, бумага мялась, киноплёнка царапалась в аппарате, магнитные ленты растягивались и «зажёвывались». Исторические источники портились и от времени и от использования.
Если у нас есть две книги из одного тиража, из которых одна полвека пролежала нетронутой в библиотеке, а вторая всё это время ходила по рукам и активно использовалась, то про вторую мы скажем «изношенная». Это может быть не только книга, а и любой другой источник информации — карта местности, фотография, аналоговая аудиозапись и пр. Чем чаще мы обращаемся к физическому носителю, тем больше он изнашивается и утрачивает собственные свойства. А так как информация хранится в виде физических свойств носителя, то из-за износа носителя она искажается или полностью утрачивается.
Существовало мнение о том, внедрение цифровых технологий позволило разорвать жёсткую связь между информацией и её носителем. Цифровые документы можно копировать между носителями, их можно передавать по компьютерным сетям, к ним можно обращаться бесконечное число раз и они останутся в первоначальном виде.
Цифровые документы не выцветают от времени, не мнутся, не царапаются — они не подвержены износу и вечны.
К сожалению, это мнение является иллюзией.
Точно так же, как аналоговый источник информации был неотделим от своего физического носителя, цифровой — неотделим от цифровых технологий. И хотя в теории цифровые документы продолжают оставаться вечными, используемые на практике технологии приводят к тому, что цифровые документы искажаются.
Так же как и аналоговые источники информации, цифровые оказались подвержены явлениюутраты потребительских свойств в процессе эксплуатации, то есть — износу.
Только износ этот не физический, а цифровой. При этом, так же как и физический износ, цифровой износ является не каким-то конкретным техническим явлением (например “дефектом поколений” [3]), а совокупным результатом всех воздействий на цифровой документ.
Не смотря на значительные различия между физическим и цифровым износом, эти явления совпадают в самом главном моменте.
Износ происходит из-за того что мы работаем с документом, и чем чаще и интенсивней мы с ним работаем — тем сильнее износ.
Источники:
1 - «Цифровой износ — старое явление на новый лад» // https://habr.com/ru/post/340714/
2 - Амосов А. И. ИЗНОС // Большая российская энциклопедия. Электронная версия (2016); https://bigenc.ru/economics/text/2002434 Дата обращения: 19.04.2020
3 - https://en.wikipedia.org/wiki/Generation_loss
4.1 - Иллюстрации в электронных книгах
Самой наглядной иллюстрацией цифрового износа являются изменения происходящие с графическими файлами.
Графические файлы требуют для хранения большого объёма дискового пространства и, как следствие, значительных финансовых затрат. Из-за этого, очень часто, различные интернет-сервисы уменьшают пересылаемые или загружаемые пользователем графические файлы.
Уменьшение графических файлов может происходить не только при загрузке в социальную сеть или отправке через мессенджер, но и при загрузке файлов на специализированные сервисы для размещения фотографий [1].То есть, цифровой износ фотографий может происходить в самых разных местах.
Происходит он и при работе с литературными сайтами, используемыми авторами для написания или хранения собственных книг в электронной форме.
Для демонстрации цифрового износа на литературных порталах я провёл эксперимент. В рамках этого эксперимента был воспроизведён реальный процессзагрузки книги «Цифровое источниковедение - специфические проблемы» на сайту «ЛитМаркет» и «author.today».
В процессе данного эксперимента сравнивались размер файла и количество пикселей которое изменилось в результате перекодирования на каждом этапе.
Так как сама книга находится в процессе редактирования, для эксперимента были созданы специальные тестовые файлы,которые останутся неизменными.
1) Был создан изначальный файл с уменьшенным изображением обложки книги.[2](Файл был уменьшен специально для того, чтобы исключить уменьшение пиксельного размера и показать факт перекодирования.)
2)Графический файл был добавлен в текст книги, который я пишу в редактореLibreOffice. После чего код графического файла был извлечён и проанализирован. Размер и цвет всех пикселей данного файла и исходного полностью совпали.
3) Текстовый файл формата odt был загружен в сервис Google Docs для совместной работы с бета-ридлером. После редактирования, из Google Docs был выкачан файл формата docx(«ЛитМаркет» понимал только этот формат).
Анализ показал, что у графического файла изменился размер и цвет у 509524 пикселей из 1454000. То есть, после того как текстовый документ был загружен в Google Docs,отредактирован и скачан — в содержащейся в нём иллюстрации изменился цвет 35% пикселей.
4) Оказалось, что «ЛитМаркет» не понимает форматаdocx-файла скачанного сGoogle Docs (и тут вина Google Docs — он создаёт файл не самого корректного формата ). Файл был открыт в LibreOffice и просто пересохранён. Это привело форматdocx-файла к корректному виду.
Анализ показал, что содержащаяся в текстовом файле иллюстрация не изменилась.
5) docx-файл был загружен на «ЛитМаркет» и скачан в виде fb2-файла.[3] Это понадобилось потом, что сайт «author.today» не позволял закачать docx-файл, но позволял закачать fb2-файл.
Анализ иллюстрации содержащейся в скачанномfb2-файле показал, что хотя её размер в байтах и изменился (увеличился!), но она попиксельно-идентична той что содержалась в загруженномdocx-файле
6) fb2-файл был загружен на «author.today» и снова скачан в виде fb2-файла. [4]Это был финальный этап эксперимента в котором был смоделирован реальный пример жизненного цикла электронной книги.
Анализ показал, что иллюстрация содержащаяся в fb2-файле скачанном с «author.today» не идентична той которая была в залитом fb2-файле. Изменились и размер файла и цвет 20% пикселей по сравнению с предыдущим файлом.
Однако, так как изменились в основном уже изменённые пиксели, то по сравнению с первоначальным файлом были изменены лишь 36% пикселей.
Таблица 1. Результаты эксперимента по цифровому износу иллюстраций в электронных книгах
Получается, что когда мы работаем с файлами электронных книг, их иллюстрации могут подвергнуться цифровому износу. Это происходит даже в ситуации, когда форматы заливаемого и скачиваемого файлов совпадают. (Данный вывод верен не только дляfb2-файлов «author.today» , но так же и для odt-файлов прошедших через Google Docs).
Это контринтуитивно и вдвойне неожиданно для людей не знакомых с понятием цифрового износа. Потому, что изменение произошло в файле формально сохранившем свой формат (fb2), и в графической иллюстрации — элементеэлектронной книги который, в отличии от текста, не воспринимается как редактируемый/изменяемый.
Изменения на каждом этапе могут быть не заметны для глаза, но они есть и могут накапливаться при каждой заливке-скачивании файла.
Изменения накопленные в результате данного эксперимента выглядят вот так (чёрный цвет соответствует не изменившимся пикселям.)
Следует так же уточнить, что результаты данного эксперимента нельзя трактовать как победу «ЛитМаркет» над «author.today».
Не смотря на то, что «ЛитМаркет» не повредил иллюстрацию при загрузке из docx-файла у него обнаружились другие особенности.
Если осуществлять редактирование книги через интерфейс на веб-сайте, то заливаемая таким образом иллюстрация будет уменьшена в размере — с 1000x1454 пикселей до 688x1000 пикселей. [3]
Ручное добавление иллюстрации на «author.today» так же дало результат отличный от импортирвоания fb2-файла. В обоих случаях у иллюстрация остался исходный пиксельный размер 1000x1454, но при этом у них различаются и размер файла и цвет у 21,5% пикселей. [4]
Таким образом, можно сделать следующие выводы из проведённого эксперимента:
- цифровой износ может происходить не только при редактировании файлов, но и в случае когда пользователь считает, что он «просто заливает файл»
- цифровой износ может происходить даже при формальном сохранении формата файла
- цифровой износ может происходить даже с теми элементами которые не должны были изменяться
- цифровой износ может по разному происходить даже в пределах одного и того же онлайн-сервиса
То есть, цифровой износ следует рассматривать как неизбежное и объективно существующее явление.
Источники:
1 - Тестирование фотохостингов на цифровой износ (21 шт) // https://habr.com/ru/post/341238/
2 – Исходный файл // https://muxa.ru/img/cifrovoe-istochnikovedenie/cifrovoe-istochnikovedenie_4.1_1000.jpg
3 - Цифровое источниковедение – 4.1(тестовый файл) // https://litmarket.ru/books/cifrovoe-istochnikovedenie-41-illyustracii-v-elektronnyh
4 - Цифровое источниковедение - 4.1(тестовый файл) // https://author.today/work/63609
4.2 - ...
(раздел в процессе наполнения)
5. Утрата вариантов
Цифровые технологии существенно облегчили жизнь людям пишущим тексты, создающим иллюстрации, проектирующим технику и многим другим специалистам.
В любой момент можно внести любую правку в любом месте текста. Добавить в середину не только отдельные слова, а любое количество текста. Или наоборот — удалить.
Художники могут добавлять и удалять на картины любое количество новых персонажей или предметов. Производители - заменить файл со старой инструкцией на новую. Продавцы книг — начать продавать новое издание книги, не беспокоясь о нераспроданном предыдущем издании. Конструкторы — дорабатывать чертежи и отправлять их на производство взамен прежних.
Огромное множество профессий получили возможность лёгкой правки, обновления и актуализации создаваемых ими произведений.
Я сам пользуюсь этими возможностями при написании данной книги, добавляя в структуру новые главы, изменяя их порядок или перемещая их между разделами.
Но то что является плюсом для меня как писателя, является кошмаром для меня как исследователя. Потому, что для меня, как и для многих других историков и исследователей, информация об изменениях является важной и полезной для лучшего понимания предмета исследования.
И дело даже не в факте наличия или отсутствия бумажных рукописей, которые сами по себе являются ценным историческим источником. Конечно же, изменение почерка, стоимость бумаги, состояние документа - всё это может рассказать об условиях в которых создавалось произведение и состоянии автора. Например, в 2016 году в журнале «Journal of Proteomics» была опубликована статья с результатами исследований рукописей Михаила Булгакова в период с 1936 по 1940. Листки содержали следы наркотика (морфина) и белков, указывающих на болезнь почек.
Подобные источники могут много рассказать нам об авторах и их жизни, но данном разделе книги главным является другое проявление черновиков. Сейчас речь идёт не столько о рукописи/черновике как физическом объекте, сколько о том, какую информацию можно получить изучая написанные на них тексты и сравнивая эти тексты между собой.
Для литературоведов, авторские черновики являются ценнейшим источником информации о том, как создавалось произведение и какой смысл мог вкладывать автор в свой текст.
(рукопись пьесы «Каменный гость», А.С.Пушкин )
Исследователям изучающим различные события часто приходится иметь дело с правками на черновиках важных документов — это позволяет лучше понять логику принятия того или иного решения.
Сам я, как историк техники, был бы счастлив видеть чертежи всех прототипов изучаемой мной железки, и очень рад возможности сравнивать разные издания одной и той же книги — это позволяет понять что считалось важным в момент публикации каждого издания и что изменилось между изданиями. Так же, в первом издании книги могут быть приведены примеры машин и механизмов не попавшие в её второе издание.
Таким образом, черновики и различные версии одного и того же произведения имеют не только культурную, музейную или антикварную ценность, но и являются историческими источниками дающими полезную информацию.
Получается, что из-за «недостатков» присущих материальным источникам (рукописям, книгам, отчётам, картинам и пр) шёл самопроизвольный процесс сохранения версий и накопления связанной с этим информации.
Раньше, создание новой версии произведения не означало автоматического уничтожения его предыдущей версии. Старые версии накапливались сами собой и для их уничтожения приходилось принимать соответствующее решение и предпринимать соответствующие усилия. Даже если черновик просто выбрасывался, это было принятием решения и воплощением его в жизнь.
Однако, с приходом новых технологий и электронных цифровых источников, ситуация в корне поменялась. Теперь предыдущие версии уничтожаются автоматически при сохранении отредактированного файла. И если в случае с материальными источниками приходилось предпринимать усилия по уничтожению предыдущих версий, тов случае с цифровыми источникам ситуация прямо противоположная - приходится предпринимать усилия именно для сохранения предыдущих версий.
5.1 - Бэкапы не спасают
Тема использования бэкапов и их значения в работе с цифровыми источниками раскрыта в соответствующей главе, а сейчас речь пойдёт об использовании бэкапов в свете проблемы утраты черновиков документов.
* * *
Создание бэкапов (резервных копий) многими воспринимается как сохранение файлов навечно, и как процесс аналогичный помещению копий документов в архив или на склад. Это может создать ощущение, что у вас есть некая изначальная версия файла, когда-то помещённая на этот виртуальный склад, и в любой момент времени эту версию можно получить.
Да, в теории это могло бы быть так, но в реальности существуют финансовые и технические ограничения. Они обусловлены тем, что хранение резервных копий требует большого размера хранилищ и, как следствие, больших финансовых затрат.
Поэтому, на практике существует различные схемы ведения бэкапов и такое понятие как «глубина бэкапа» - максимальное время хранения резервных копий.
Вот пример из руководство пользователя к программе для создания и управления резервными копиями - Acronis Backup Advanced 11.7.
Это план по которому будут создаваться серии резервных копий: ежедневных (Д), еженедельных (Н) и ежемесячных (М).
Резервная копия созданная с четверга по пятницу считается «ежедневной». Созданная в пятницу - «еженедельной». Если это последняя пятница месяца, то резервная копия считается «ежемесячной».
Обычно, сроки хранения для «ежедневных» копий составляют 1-2 недели, для «еженедельных» - 1-2 месяца, для «ежемесячных» - 1 год.
Но для разных случаев эти сроки могут изменяться, и в указанной выше инструкции приведён пример настроек для финансовых консультантов. Как указано, особенностью этих специалистов является работа с финансовыми документами, отчётами и электронными таблицами.
Рекомендованное время хранение «ежедневных» и «еженедельных» резервных копий составляет 6 месяцев, а «ежемесячных» - 5 лет. В пояснениях указано «Такой архив позволит сравнивать финансовые документы по состоянию на первый и последний день работы, а также иметь пятилетнюю историю всех документов и т. п.»
Данное техническое решение предполагает что нет необходимости хранить версии документов старше 5 лет. Возможно, для финансовых консультантов это приемлемое решение обусловленное сроком давности по соответствующим видам правонарушений. Оно позволяет хранить только актуальные документы, но не расходовать финансовые и технические ресурсы на хранение более ненужных правок.
Однако, если речь идёт не об актуальных задачах по документообороту, а об исследованиях, статьях или книгах, то 5 лет это очень маленький срок. Это может прозвучать излишне пафосно, но да - таким как мы хотелось бы иметь механизм вечного хранения наших черновиков.
Конечно, можно увеличить срок хранения резервных копий до бесконечности, но это может потребовать слишком большого размера дискового пространства. И даже если Вы готовы пойти на это, то возникает ещё одна проблема — сложность работы с файлами в резервных копиях.
Сам по себе механизм бэкапов предназначен для хранения и восстановления файлов. Он не предполагает поиск по различным версиям файлов и изучение таким образом истории правок. Так же, есть риск того, что при неправильном обращении с программами управления резервными копиями, старая копия будет записана поверх более свежей версии файла и это приведёт к утрате части проделанной работы.
Таким образом, получается, что бэкапы это средство для временного сохранения свежих версий файлов с их последующим автоматическим удалением, а восстановление файлов из бэкапов является рискованной процедурой которую можно производить лишь в случае особой необходимости.
Данный вывод не означает что деланье резервных копий это бесполезное и ненужное занятие. Совсем наоборот — резервные копии нужны и в какой-то момент могут спасти результаты ваших многолетних трудов.
Но необходимо помнить о том, что бэкапы не являются механизмов ведения черновиков и сохранения правок. Они для этого не предназначены и не приспособлены.
Бэкапы не способны заменить механизма сохранения версий. Они должны работать вместЕ, а не вместО.
5.2 - ...
(раздел в процессе наполнения)
6. Полная утрата цифровых источников
Как уже было показано ранее, с цифровыми источниками возникают риски сходные с теми, которые известны исследователям работающим с «аналоговыми» источниками: фальсификация, искажение, уменьшение разнообразия и износ в результате оборота.
К сожалению, этот список необходимо дополнить таким явлением как полная утрата цифрового источника.
Самым очевидным способом утраты цифрового источника является физическое повреждение носителя информации или сбой в его работе. Эта ситуация во многом повторяет утрату аналоговых носителей информации. Электронный носитель цифровой информацией может быть уничтожен так же как и бумажная книга. В этом случае будет утрачена вся информация.
История знает огромное количество примеров того, как различные исторические источники сгорали, тонули, разбивались или просто сдавались на переработку. И как историк техники я представляю сколько образцов этой самой техники было сдано на переплавку, а документация по разработке и использованию — в макулатуру.
Кроме ситуации полного уничтожения, электронный носитель информации может быть повреждён и выведен из строя, но содержащаяся в нём информация может быть доступна для извлечения с помощью специального оборудования.
Этот вариант так же имеет свои эквиваленты в мире аналоговых источников. Известны случаи использования рентгеновских аппаратов для прочтения повреждённых свитков которые невозможно распрямить для прочтения обычным способом:
- в 2015 году, итальянскими исследователями была опубликована статья об успешных попытках прочтения свитка из древнеримской библиотеки, погребённой в 79 году до н.э. Библиотека была погребена во время извержения вулкана Везувий, погубившего города Помпеи и Геркуланум.
- в 2018 году, Кардиффский университет (Великобритания) сообщил о том что его сотрудники осуществили «виртуальное распутывание» свитка 16 века повреждённого в пожаре.
(фото: Кардиффский университет — cardiff.ac.uk )
И хотя при чтении слипшихся старинных свитков и извлечение информации из повреждённого электронного носителя информации используются разные технологии, эти действия являются эквивалентными.
Получается, разрушение или повреждение носителя цифровой информации не является специфической проблемой именно цифрового источниковедения. Однако, особенности цифровых технологий и принципы функционирования Интернета создали новые риски связанные с уничтожением исторических источников.
6.1 - Ложное срабатывание антивируса
Данные вариант утраты цифровых источников является не только ярким примером специфической угрозы присущей только цифровому источниковедению, но так же он является самым обидным.
Это обусловлено двумя фактами.
1. Источником угрозы служит программа предназначенная для защиты информации. Особенностью работы данного типа программ является то, что они функционируют с максимальными правами и, как правило, устраняют угрозы в автоматическом режиму.
2. Под угрозой находятся уже спасённые цифровые источники. Они были обнаружены исследователем и скопированы на компьютер который исследователь контролирует.
Дело в том, что одним из методов используемых антивирусами для поиска файлов с угрозами является поиск внутри файлов кода соответствующего примерам хранящимся в базе антивируса.
Используя данный метод, антивирус может допускать ошибки в обе стороны — не замечать файлов с реальной угрозой или реагировать на безопасные файлы как на угрозу.
В данной главе речь идёт именно о ложном срабатывании антивируса, воспринявшего безопасный файл как угрозу.
Суть проблемы
На начальном этапе развития IT-индустрии, нормальным поведением антивируса при обнаружении угрозы было уведомление пользователя и запрос о том как следует поступить с найденной угрозой. При желании, пользователь мог отключить эти уведомления и перевести программу в автоматический режим, при котором угроза устраняется без участия пользователя.
Однако, по мере роста числа пользователей компьютеров изменились и характеристики «типичного пользователя». Современный типичный пользователь компьютера не только нервничает при сообщениях об обнаруженных угрозах, но и так же может принять неправильное решение о том что действительно опасный файл является якобы безопасным.
Следствием изменение демографии компьютерных пользователей стало изменение нормального поведения антивирусов — они стали работать в беззвучном автоматическом режиме. Уведомления об обнаруженных и устранённых угрозах стали комфортными и приятными, то есть такими, что пользователи перестали их замечать.
Ситуация усугубляется тем, что в актуальной на момент написании данной книги «Windows 10», эти уведомления показываются в течении короткого времени и потом уходят в общую ленту уведомлений, в которой могут затеряться среди сообщений от других программ.
Я сам тоже сталкивался в примерами ложного срабатывания антивируса, и самые яркие из них связаны с моей деятельностью как веб-разработчика.
В одном случае, в 2013 году, антивирус DrWeb при первом запуске обнаружил у меня специфические настройки Windows (отредактированный файл hosts ) которые на компьютере обычного пользователя указывает на заражение компьютера вирусами. Без какого либо запроса, мой компьютер был успешно «вылечен».
Другой случай произошёл прямо во время написания данной книги. Мне часто приходится работать с файлами содержащими техническую информацию о моих веб-сайтах. Нередко, в таких файлах содержатся следы попыток атаки на веб-сайты. Обнаружив такие следы в одном из файлов, антивирус Касперского предложил мне устранить угрозу... вместе с самим файлом.
И если в случае с DrWeb речь действительно шла о возможной угрозе, то Касперский попытался удалить не программу, а документ содержащий техническую информацию.
Получается, что из-за возможного ложного срабатывания, под угрозой бесшумного автоматического удаления находятся не только компьютерные программы, но и любой компьютерный документ. То есть, в нашем случае, под угрозой находится любой цифровой источник.
Ситуация отягощается ещё одной особенностью описанного выше метода поиска вирусов с использованием базы примеров — постоянным пополнением этой базы.
Это означает, что в любой момент времени антивирус может получить новые примеры кода вирусов и среагировать на файл которые до этого считался безопасным.
Такой файл может быть сохранённой когда-то html-страницей, doc-файлом или любым другим архивным текстовым и не текстовым документом.
В случае, если этот файл будет частью какого-то большого массива документов (выпуски газет и журналов, отчёты и каталоги производителей техники и т. п.), его пропажа может оставаться незамеченной в течении долгого времени, но при этом отражаться на результатах поиска информации в этих документах.
Способы борьбы
Необходимо понимать, что данная проблема не решается с помощью грамотного хранения резервных копий (бэкапов).
Во-первых, потому что файлы могут быть удалены антиврусом и из бэкапов в момент работы с носителем на который происходит сохранение резервных копий.
Во-вторых, при достаточно долгом отсутствии файла на рабочем компьютере, может не остаться резервных копий в которых этот файл ещё существует.
Наиболее эффективным способом предотвращение удаления файлов антивирусом является отключение в нём режима автоматического реагирования и самостоятельное принятие решения в каждом отдельном случае.
Очевидным недостатком этого способа является риск совершить ошибку в оценке ситуации и пропустить реальную угрозу. Или просто промахнуться и нажать не на ту кнопку.
Кроме того, настройки программ это не обязательная к исполнению директива, а скорее просьба и нет никакой гарантии, что даже при выключенном автоматическом режиме не произойдёт бесшумного автоматического удаления какого-либо файла. Увы, но указанные пользователем настройки могут как не учитываться, так и могут быть переопределены при обновлении программы антивируса.
Поэтому, учитывая эти возможности, самым разумным поведением будет ведение списка имеющихся электронных документов. Это не защитит файлы от удаления, но позволит узнать о том, что такое удаление произошло.
Так же, если позволяет функционал антивируса, можно указать как можно более долгий срок ведения журнала антивируса и хранения заражённых файлов в «карантине». Регулярное изучение журнала антивируса повышает шанс на то чтобы своевременно обнаружить ложное срабатывание и предпринять меры по спасению утрачиваемого документа.
Мне так же стоит напомнить, что вариант с удалением или временным отключением защиты на компьютере не является сколь либо разумным способом борьбы с описанной в данной главе угрозой для цифровых источников.
Активная деятельность историка, да и любого исследователя, в Интернете связана с посещением самых разных веб-сайтов, в том числе, тех которые могут нести в себе различные угрозы.
10 - Утрата переписок
Переписки писателей, переписки политиков, переписки заводов с министерствами — это всё ценнейшие источники информации о событиях и людях. Так же как по черновикам, по ним можно проследить логику принятия решений, процесс создания новой техники или развитие личности интересующего нас человека.
Однако, переписки имеют очень важное отличие от черновиков — отправленные письма уходят к получателю. Эта странная формулировка означает то, что отправленное письмо, отчёты или другие послания перемещались от отправителя к получателю. По крайней мере, так было во времена писем на материальных носителях — бумаге, бересте, папирусе и т.д.
Таким образом, получалось что при ведении переписки бумажными письмами, каждый из участников переписки имеет в своём архиве только отправленные ему чужие письма, но не имеет писем отправленных им самим.
Так как эта проблема является достаточно очевидной, были созданы организационные и технические решения для создания копий отправляемых писем.
В случае с официальной перепиской, в обязанности помощников и секретарей входило создание снятие копии с отправляемого документа или создание документа с нескольких экземплярах. Последнее, хорошо известно исследователям новейшей истории по многочисленным машинописным копиями сделанным прямо в процессе создания оригинала, с помощью копировальной бумаги и второго листа заправленного в печатную машинку.
Нельзя сказать, чтобы участники частных переписок совсем не создавали копий отправленных писем. Такие примеры есть, но чаще всего этим занимались известные персоны обладающие не только желанием иметь собственные копии отправленных писем, но и возможностями эти желания осуществить. В их число входят немецкий писатель Иоганн Гёте [1,стр.35] и Лев Николаевич Толстой [2,стр.14].
Однако, не смотря на все сложности и затраты, связанные с созданием копий отправленных писем, этот процесс оказался важным и полезным для исследователей. Так, из 8,5 тысяч писем Льва Толстого вошедших в полное собрание сочинений, 1300 сохранились только в виде таких копий.
Главным образом, это копии писем написанных в последние годы жизни Льва Толстого — после 1898 года. Первоначально, семья и помощники писателя пытались делать рукописные и машинописные копии писем, которые они считали важными, но после того как Владимир Чертков (секретарь Толстого) привёз специальный копировальный пресс, ситуация изменилась.
«Чертков... вначале мы с Машей думали, что приобрели в нем ценного помощника для нашей главной обязанности, а именно для переписки рукописей отца. Чертков достал нам копировальный пресс: таким образом сохранялись копии всех писем. До тех пор мы довольствовались тем, что копировали лишь наиболее важные. Каждая запись в дневнике, который вел отец, едва сделанная, тут же копировалась, и копия передавалась Черткову.» [3,стр.266]
«Ремингтонная» или «Секретарская»[4,стр.40]
Пресс о котором идёт речь (не знаю, тот же самый или просто аналогичный) можно увидеть на фотографиях из усадьбы-музея «Ясная поляна» — он стоит в помещении известном как «Секретарская» или «Ремингтонная». Технология использовавшаяся при копировании была простой и в конце 19-го векауже применялась в деловой сфере. Надо было просто писать специальными чернилами и копировать свеженаписанный текст в специальную «копировальную книгу». [5, стр.167]
Это был простой и эффективный способ получения точных копий рукописных документов, благодаря которому у нас теперь есть 9 «копировальных книг» с письмами и дневниковыми записями Льва Толстого.
Как видим, при желании, упорстве и необходимых ресурсах можно было организовать процесс переписки так, чтобы и текст письма был не только у его получателя, но и у самого автора письма.
Однако, как отмечается и в специализированной[6, стр. 195 ]и научно-популярной литературе [7,стр.107], мало кто из авторов утруждает себя созданием отправляемых ими копий бумажных писем.
Ведь даже в случае с Львом Толстым, известным писателем и звездой мировой величины, понадобился инициативный и высокомотированный помощник, который начал использовать уже имеющуюся на тот момент технологию.
* * *
На первый взгляд, ситуация с сохранением исходящих писем прямо противоположна ситуации с сохранением черновиков (раздел 5 «Утрата вариантов»).
В случае с черновиками, особенности работы с материальными носителями текста приводили к самопроизвольному возникновению копий одного и того же произведения на разных этапах его создания. Черновики накапливались и для их уничтожения приходилось принимать решение и прикладывать усилия. Переход на цифровые технологии привёл к тому, что теперь черновики самопроизвольно уничтожаются и нужно предпринимать усилия именно для их сохранения.
Однако, в случае с переписками, наоборот нужно было предпринимать усилия для создания копий бумажных исходящих писем, в то время как электронные сообщения сохраняются самопроизвольно. И каждый, кто хоть раз вёл переписку в интернете, отправлял электронное письмо или писал сообщение в мессенджере, знает — исходящие отправленные сообщения сохраняются и всегда доступны.
К сожалению, ситуация не настолько простая.
Конечно же, в большинстве случаев ведения переписок в электронном виде у отправителя остаётся копия его сообщения для создания которой не надо прилагать никаких усилий. Но для того, что бы действительно сохранить эти сообщения, нужно приложить отдельные усилия.
Потому, что в данном случае, кроме уже описанных ранее вариантов утраты цифровых источников существуют специфические риски, связанные именно с ведением переписок в электронном виде и их сохранением.
ИСТОЧНИКИ:
1 - Как работали Гете, Шиллер и Гейне / А. Г. Горнфельд ; вступительная статья И. М. Нусинова. - Москва : Кооперативное изд-во "Мир", 1933
2 — Письма Л.Н.Толстого в копировальных книгах / Л.В.Гладкова. Журнал «Новый мир» - 1991 №7
3 - Литературное наследство. Том 69: Лев Толстой. Кн. 2 / АН СССР. Ин-т мировой лит. им. А.М. Горького; Ред. С.А. Макашин;. — М.: Изд-во АН СССР, 1961.
4 - Ясная Поляна / А.И. Поповкин - Москва : Детгиз, 1956
5 - Энциклопедический словарь Брокгауза и Ефрона/ т. XVI — 1895
6 - Источниковедение новейшей истории России : учебное пособие / Ю. А. Русина ; М-во образования и науки Рос. Федерации, Урал. федер. ун-т. – Екатеринбург : Изд-во Урал. Ун-та, 2015
7 - Беседы об архивах / М. Чудакова. - Москва : Мол. гвардия, 1975
10.1 - ...
(глава в процессе написания)
999. Технические пояснения
Книга разбита на тематические разделы, которые в свою очередь разбиты на главы с конкретными примерами.
По состоянию на 2020-02-16, предварительное количество разделов — 10, примерное количество глав в каждом разделе — 5.
Спасибо за чтение
Вернуться к книге
