В том, что будущее за электронными библиотеками, никто и не сомневается. Текст — и исторически самая первая разновидность информации, которую стали хранить в цифровой форме, и легче всего, практически без потерь, поддающаяся такому преобразованию. К тому же уже скоро третий десяток лет пойдет, как и преобразовывать ничего не требуется: тексты стали готовить на компьютерах изначально, так что цифровая форма их представления стала естественной. Для того чтобы произошел переворот в книгоиздательском деле, осталось совсем немного: придумать еще и «читалку», столь же удобную, как печатная книга. И некоторые наработки в этом деле на горизонте уже просматриваются.
Но вот вопрос: а что делать с накопленными богатствами? Теми самыми печатными книгами, от которых ломятся полки Библиотеки конгресса США, вынужденного даже внедрить специальную роботизированную систему поиска книг, чтобы выдача их происходила в приемлемые сроки. В хранилищах Российской государственной библиотеки более 40 миллионов единиц хранения, и за первые три года существования в ней отдела поддержки электронных библиотек было оцифровано всего лишь 13 тыс изданий. Компания Google заявила, что выделит 3 миллиона долларов для Библиотеки конгресса для создания цифровых копий одних только редких документов. Как видите, оцифровка книг — трудоемкое и дорогое занятие, и если оно будет двигаться сегодняшними темпами, человечество попросту когда-нибудь будет поставлено перед фактом, что большая часть текстового наследия окажется практически утерянной для потомков, привыкших все получать одним движением мышки.
Одна из главных трудностей в том, что не любой текст поддается автоматическому распознаванию и при профессиональной оцифровке во избежание ошибок приходится долго выверять и расшифровывать сложные фрагменты вручную. И вот ученым из Университета Карнеги-Меллона в США пришла в голову блестящая идея. Исследователи подсчитали, что пользователи Интернета ежедневно распознают порядка 60 миллионов т.н. изображений CAPTCHA (от английского Completely аutomatic Public Turing Test to Tell Computers and Humans Apart — «полностью автоматический тест Тьюринга для различения компьютеров и людей»). Такие изображения встречались любому, кто когда-нибудь регистрировался в системе, например, бесплатной электронной почты: пестрая картинка с буквами или цифрами, специально написанными каким-нибудь изломанным шрифтом, которые требуется ввести вручную. Делается это с целью защиты от программ-роботов, осуществляющих автоматическую регистрацию — самостоятельно компьютер распознать такой текст не может. Но ведь именно это задача и стоит перед теми, кто занимается оцифровкой книг, сообразили ученые! Исследователи приняли время распознавания одного изображения за десять секунд и получили, что ежедневно пользователи Сети тратят порядка 150 тысяч человекочасов на разгадывание зашумленных искусственным образом картинок. Так почему бы не подсунуть интернетчикам фрагменты, реально требующие распознавания? Вопрос только в том, чтобы определить, насколько пользователь честен: ведь в отличие от настоящих CAPTCHA, здесь ответ заранее неизвестен.
Получилась система под названием reCAPTCHA, которая работает следующим образом: пользователю предлагается распознать два слова, одно из которых службе reCAPTCHA известно, а второе — нет. Если пользователь правильно решает задачу с уже известным ответом, то система считает, что он правильно распознал и неизвестное слово. С целью повышения вероятности правильного распознавания одно и то же слово предлагается нескольким пользователям. Уже написаны программы для внедрения системы в любые интернетовские сервисы. Так что помните — разгадывая очередную картинку для регистрации на каком-нибудь форуме, вы, возможно, работаете на будущее всей культуры.