Русский алфавит. частотность букв русского языка (по нкря)

Подписаться
Вступай в сообщество «hatewall.ru»!
ВКонтакте:

so dominating and happy individuality that Youth is drawn to him as is a fly to a sugar bowl. (см. ).

Весьма немногие могут заметить в данном тексте что-нибудь необычное, даже прочитав гораздо больший отрывок из этой книги, пока их не попросят очень внимательно его изучить. И даже после этого большинство не в состоянии заметить эту уникальную особенность.

Частоты встречаемости букв в других языках, кроме английского

Для любого языка с алфавитной записью шифр простой замены вскрывается описанным выше методом: подсчетом частот встречаемости знаков с последующим использованием контекстной информации языка. Ясно, что для этого криптоаналитику необходимо по крайней мере неплохо знать язык, хотя в случае шифра простой замены ему не обязательно говорить на нем свободно. Не менее очевидно, что подсчет частот встречаемости знаков в типичном отрывке текста будет для разных языков давать разные результаты, хотя для языков с общей основой, такой как латынь, это отличие будет меньше, чем для языков различного происхождения. Не во всех языках используется 26-буквенный алфавит; в некоторых букв меньше - в итальянском обычно употребляются только 22; в других, например в русском, букв больше, а в третьих (например, в китайском), алфавита вообще нет. Поскольку итальянцы обычно не используют буквы K, W и Y, то их частоты полагают равными нулю, но если в итальянском тексте упоминается Нью-Йорк (New York), то и эти буквы в нем встретятся. Во французском и немецком языках необходимо различать гласные с различными диакритическими знаками (акцентами и умляутами), но ради упрощения приведенных ниже таблиц все формы одной и той же буквы подсчитывались вместе. Так, для французского языка частоты букв E, E, E и E учтены вместе в суммарной частоте буквы E. Числа также исключены из подсчета, кроме тех, которые записаны словами; все неалфавитные символы (пробел, запятая, точка, кавычки, точка с запятой и т.д.) учтены в графе "другие". Заглавные и строчные буквы считались одинаковыми. В таблице 2.6 приведены (с учетом приведенных оговорок) частоты встречаемости букв для четырех европейских языков в расчете на 1000 знаков. Для удобства мы повторяем здесь таблицу частот встречаемости букв английского языка.

Статистический анализ этих подсчетов показывает, что если речь идет о частотах встречаемости одиночных знаков, то английский, французский, немецкий и, в меньшей степени, итальянский языки довольно близки, а их родство с валлийским заметно слабее. Частично это объясняется тем, что в валлийском языке Y - очень частая буква: она является гласной и имеет два

различных произношения. В английском языке она встречается гораздо реже, а в других языках и вовсе очень редка. Подсчеты также показывают, что букву N можно назвать "наиболее постоянной буквой", поскольку во всех пяти языках частота ее встречаемости практически одинакова - от 6% до 7% всех букв латинского алфавита. Объяснение сути статистических тестов, применяемых обычно для сравнения частот, подобных приведенным здесь, можно найти в ; дополнительный комментарий содержится в приложении M20.

Таблица 2.6

английский

французский

немецкий

итальянский

валлийский

Сколько знаков необходимо для дешифрования простой замены?

Выше в примере 2.2 у нас было в наличии 265 знаков, и дешифрование простой замены оказалось не очень трудным делом. Смогли бы мы справиться с ним столь же легко, будь у нас, к примеру, 120 знаков? И вообще (этот вопрос уже ставился нами ранее), каково минимальное число знаков, которое, скорее всего, окажется достаточным для криптоаналитика при дешифровании подобного шифра? На данный вопрос отвечает теория информации: оценку этого числа дает формула, зависящая от частот одиночных знаков или полиграфов языка. В описано применение этой формулы для конкретного приложения. Если использовать только частоты отдельных знаков, то для шифра простой замены, возможно, окажется достаточно 200 знаков, но использование диграфов (таких как ON, IN или AT) или триграфов (таких как THE или AND) чрезвычайно усиливает возможности дешифрования. Полагают, что в этом случае может оказаться достаточно всего 50 или 60 знаков.

Задача 2.1 Перехвачен шифрованный текст на английском языке длиной 202 знака.

Известно, что использован шифр простой замены, и что пробелы в открытом тексте заменены на букву Z, а все остальные знаки препинания опущены. Есть основания полагать, что автор предпочитает использовать устаревшую форму местоимения "thy" вместо местоимения "your". Дешифруйте текст.

VHEOC WZIHC BUUCW HDWZB IRWDH TDOZH VIHVI YBWIU HQOWU HUFWH ZOXBI LHTBI LWDHG DBUWE HVIRH FVXBI LHGDB UHZOX WEHOI HIODH VCCHU FPHQB WUPHI ODHGB UHEFV CCHCN DWHBU HSVYJ HUOHY VIYWC HFVCT HVHCB IWHIO DHVCC HUFPH UWVDE HGVEF HONUH VHGOD RHOTH BU

Пример 2.2 показывает, что хотя шифры простой замены вскрыть гораздо сложнее, чем шифры Юлия Цезаря, всё же их слишком легко дешифровать, и поэтому применение их не имеет большого смысла. Для вскрытия такого шифра криптоаналитику всего лишь необходимо иметь достаточный объем шифрованного текста (это соответствует первой ситуации, упомянутой в предыдущей главе). Если ему известен также и соответствующий открытый текст (как во второй ситуации), его задача становится просто тривиальной, если только "сообщение" не состоит из очень малого числа различных букв. В третьей ситуации, когда у криптоаналитика есть возможность подобрать текст для зашифрования, ему достаточно задать такое "сообщение":

ABCDEFGHIJKLMNOPQRSTUVWXYZ

и его работа на этом завершена.

Несведущему читателю может показаться, что поскольку число различных вариантов превосходит 1026 (то есть сто миллионов миллионов миллионов миллионов), то задача вскрытия шифра простой замены только по шифрованному тексту (для решения которой методом "грубой силы", как уже отмечалось ранее, компьютеру потребуются миллионы лет для перебора всех вариантов) является невыполнимой. Однако мы только что видели, как это можно сделать вручную в течение часа, если использовать известные неравновероятные частоты встречаемости знаков и грамматические правила английского, или любого другого языка, на котором составлено сообщение, вкупе с любой доступной контекстной информацией. Из этого следует один очень важный урок:

крайне опасно судить о стойкости системы шифрования только по времени, которое необходимо затратить самому быстрому компьютеру, какой только можно вообразить, для дешифрования методом "грубой силы".

Итак, на следующем этапе мы рассмотрим способы повышения стойкости этих простых методов шифрования. Это сделано в следующей главе.

Самой распространённой буквой в алфавите русского языка можно смело назвать «о». Не «а», хотя все дети учат первые слова именно с этой буквой: «мама», «папа» или «дай». Не «и», хотя может показаться, что мы часто употребляем ее как соединительный союз.

Как показывают данные, именно буква «о» имеет частотность, превышающую 0, 1%, по сравнению с другими гласными буквами алфавита, у которых частотность составляет, например, 0,07-0,08%, это немало

Среди согласных на первом месте стоит буква «н».

Такие данные получают путем анализа частотности в НКРЯ – Национальном корпусе русского языка, по специальной формуле. НКРЯ – это электронный архив письменных и устных текстов, который состоит примерно из 230 миллионов словоупотреблений.

Рассматривая самую популярную букву нашего алфавита, стоит упомянуть об интересном явлении, которое называется «тавтограмма». Это своеобразная литературная разминка, где нужно составить рассказ или стихотворение, начинающееся с одной и той же буквы. Кстати, буква, с которой начинается больше всего слов русского языка (не путайте с частотностью употребления) - это «п», но среди гласных несомненное лидерство принадлежит нашему сегодняшнему фавориту.

«Одиноко. Очень. Осколки обаяния осыпались осенним однообразием. Олимп остался отдаленной отдушиной. Очень отдаленной. Остались обиды, опрометчивые определения оттаявшей оттепели, обусловленные огнем осязания. Остальное оказалось отрицательным, отторгнутым, обманутым обществом. Отпрыски осени оступились, облетели остатками озерных очей. Одни окна остались открытыми. Обозленные отпечатки отдельных омонимов омрачены отвергнутыми одеждами олицетворения. Оранжевые оттенки облепихи очерчены огромным отражением одиночества. Остальное – окостенение, оцепенение обреченности. Острова обросли обетами от очерков о определенности. Остывающие обрезки ольхи образовали одноименные окружности, обусловленные охрипшими окриками. Официальное обернулось отражением общего, отменив отрицательные определенности. Осевшие образы обидчиво объясняли осеннюю околесицу, обзывая обратное обманом. Отроки отчаянно обрисовывали очарованную осень, отрицая объективное отношение… Осень облетала оранжевыми осколками облепихи, оставляя осточертевшие оспаривания одиноким ответам…»

Забавно, правда? Не такая уж и чепуха выходит:)

Кстати, в английском языке самой распространенной буквой является “е". А согласной – “t"

Ну, и тавтограмма на английском языке:

Minerva-like majestic Mary moves.

Law, Latin, Liberty, learned Lucy loves.

Eliza"s elegance each eye espies.

Serenely silent Susan"s smiles surprise.

From fops, fools, flattery, fairest Fanny flies.

Известно, что буквенная раскладка на клавиатуре печатной машины или ПК составлена не случайным образом, а подчиняется определенным правилам. Так, в центральной части клавиатуры расположены наиболее часто употребляемые буквы, а по краям - те, что встречаются реже. Также известно, что гласные буквы используются чаще согласных. Эти сведения получены с помощью специальной формулы в Национальном корпусе русского языка.

Самые употребляемые гласные буквы

Как ни странно, буква «о» - лидер по количеству употреблений в письменной речи, как среди гласных, так и среди согласных букв. За ней следуют «а» и «и», а уже после начинаются согласные. По подсчетам специалистов, частотность использования буквы «о» составляет одну десятую процента, тогда как частотность других гласных колеблется в пределах семи - восьми сотых процента.

Наиболее популярные согласные буквы

Самой часто используемой согласной является «н». При этом наибольшее количество слов в русском языке начинаются с буквы «п». Среди гласных же по этому признаку лидирует «о».

Самой редкой согласной в русской речи считается буква «ф», используемая в словах, пришедших из иностранных языков, а также звукоподражаниях, например «фыркнуть».

Такая статистика может пригодиться при составлении тавтограмм. Суть этой словесной игры состоит в том, чтобы составить связный рассказ, каждое слово в котором должно начинаться с одной и той же буквы.

Метод, предложенный Аль-Кинди легче объяснить с точки зрения русского алфавита. Прежде всего, необходимо изучить достаточно длинный отрывок текста на русском языке, или несколько отрывков разных текстов, чтобы установить частоту появлений каждой буквы алфавита. В русском языке о - самая частая буква, после неё е , затем а и так далее, как указано в таблице. Потом изучим зашифрованный текст и установим частоту появлений каждого символа в нём. Например, если самый частый символ в зашифрованном тексте Ю , то, вероятнее всего, его следуют заменить на букву о . Если второй по частоте символ зашифрованного текста Э , то его, вероятно, следует заменить на е , и так далее. Благодаря методу Аль-Кинди, известному как частотный криптоанализ, не нужно проверять каждый из миллиардов потенциальных ключей. Вместо этого можно расшифровать сообщение просто проанализировав частоту символов в нём.

Таблица относительных частот букв русского алфавита.
Буква Частота % Буква Частота % Буква Частота % Буква Частота %
О 11,08 Р 4,45 Ы 1,96 Х 0,89
Е, Ё 8,41 В 4,33 Ь 1,92 Ш 0,81
А 7,92 К 3,36 З 1,75 Ю 0,61
И 6,83 М 3,26 Г 1,74 Э 0,38
Н 6,72 Д 3,05 Б 1,71 Щ 0,37
Т 6,18 П 2,81 Ч 1,47 Ц 0,36
С 5,33 У 2,80 Й 1,12 Ф 0,19
Л 5,00 Я 2,13 Ж 1,05 Ъ 0,02

Тем не менее частотный криптоанализ не решает полностью задачу взлома моноалфавитных шифров. Его применимость зависит от величины и характера текста. Средние частоты букв какого-либо языка не всегда будут соответствовать частотам букв конкретного текста. Например, краткое сообщение, в котором обсуждается влияние атмосферы на движение зебр в Африке «Из-за озоновых дыр от Занзибары до Замбии и Заира зебры бегают зигзагами», если будет зашифрованно моноалфавитным шифром, не удастся дешифровать с помощью простого частотного криптоанализа. Так как буква з в этом сообщении встречается на порядок чаще, чем в простой речи. В технических текстах редкая буква ф может стать довольно частой в связи с частым использованием таких слов, как функция, дифференциал, диффузия, коэффициент и т. п..

Если не удаётся расшифровать криптограмму с помощью простого частотного криптоанализа (например если сообщение слишком короткое), Ал-Кинди предлагает использовать характерные сочетания букв или, наоборот, несочетаемость определённых букв друг с другом. Например, наиболее распространённые биграммы (группы из двух букв) русского языка: ст , но , ен , то , на , ов , ни , ра , во , ко . Важна статистика сочетаемости гласных и согласных букв. Например перед буквами ь , ы , ъ и после э не могут стоять гласные, а после любой гласной буквы следует согласная с вероятностью 87 %. Так же подсказкой для криптоаналитика могут быть общепринятые вступительные слова, которые используются почти в каждом языке. Например в арабском часто употреблялось «Во имя Бога, милостивого и милосердного» (بسم الله الرحمن الرحيم). При расшифровке стихотворений можно использовать рифмы и стопы.

Арабские буквы: их порядок и повторяемость

Ал-Кинди приводит таблицу с частотами букв арабского алфавита, вычисленными в выборке из семи листов текста.

В арабском алфавите 28 букв. Из них 27 могут обозначать согласные звуки, 3 (ﺍ (/aː/), ﻭ (/uː/), ﻱ (/iː/)) - долгие гласные звуки, букв, обозначающих короткие гласные, - нет (например в слове Муха́ммед пишутся только четыре согласные буквы: محمد). Таким образом в арабском письме преобладают чисто согласные буквы. Однако этот факт не противоречит указанному в начале трактата утверждению о том что самая частая буква на письме любого языка, как правило, гласная, так как в арабском таковой является ﺍ (/aː/).

Поиск в инженерном справочнике DPVA. Введите свой запрос:

Дополнительная информация от Инженерного cправочника DPVA, а именно - другие подразделы данного раздела:

  • Алфавит английский. Английский алфавит (26 букв). Алфавит английский нумерованный (пронумерованный) в обоих порядках. ("латинский алфавит", буквы латинского алфавита, латинский международный алфавит)
  • Фонетический английский (латинский) алфавит НАТО (NATO) + цифры, он-же ICAO, ITU, IMO, FAA, ATIS, авиациионный, метеорологический. Он-же международный радиотелефонный алфавит + устаревшие варианты. Alpha, Bravo, Charlie, Delta, Echo, Foxtrot, Golf ...
  • Английский сурдоалфавит, сурдо азбука английская, азбука глухих английская, алфавит глухонемых английский, азбука немых английская, азбука глухонемых английская, язык жестов - английский, жестовый английский язык
  • Алфавит английский флажковый, семафорная английская азбука, флажковая английская азбука, семафорный английский алфавит. Флажковый семафорный алфавит с цифрами (числами).
  • Алфавиты греческий и латинский. Альфа, бета, гамма, дельта, эпсилон... Буквы греческого алфавита. Буквы латинского алфавита.
  • Английская транскрипция для учителей английского языка. Увеличить до нужного размера и распечатать карточки.
  • Азбука Морзе русский и английский алфавит. SOS. СОС. "Алфавит Морозе"
  • Эволюция (развитие) латинского алфавита от протосинайского, через финикийский, греческий и архаическую латынь до современного
  • Алфавит немецкий. Немецкий алфавит (26 букв латинского алфавита + 3 умляута + 1 лигатура (сочетание букв) = 30 знаков). Алфавит немецкий нумерованный (пронумерованный) в обоих порядках. Буквы и знаки немецкого алфавита.
  • Алфавит русский. Буквы русского алфавита. (33 буквы). Алфавит русский нумерованный (пронумерованный) в обоих порядках. Русский алфавит по порядку.
  • Фонетический русский алфавит. Анна, Борис, Василий, Григорий, Дмитрий, Елена, Елена, Женя, Зинаида....
  • Русский сурдоалфавит, сурдо азбука русская, азбука глухих русская, алфавит глухонемых русский, азбука немых русская, азбука глухонемых русская, язык жестов - русский, жестовый русский язык
  • Алфавит русский флажковый, семафорная русская азбука, флажковая русская азбука, семафорный русский алфавит.
  • Вы сейчас здесь: Русский алфавит. Частотность букв русского языка (по НКРЯ). Частотность русского алфавита - как часто встречается данная буква в массиве случайного русского текста.
  • Русский алфавит. Частотность - распределение частот - вероянтность появления букв русского алфавита в текстах на произвольной позиции, в середине, в начале и в конце слова. Независимые исследования примерно 2015 года.
  • Звуки и буквы русского языка. Гласные: 6 звуков - 10 букв. Согласные: 36 звуков - 21 буква. Глухие, звонкие, мягкие, твердые, парные. 2 знака.
  • Русско-врачебный алфавит. Русский медицинский алфавит. Очень полезный
  • Эстонский алфавит 32 буквы. Алфавит эстонский нумерованный (пронумерованный) в обоих порядках. Алфавит эстонского языка - прямая и обратная нумерация букв.
  • Эстонский сурдоалфавит, сурдо азбука эстонская, азбука глухих эстонская, алфавит глухонемых эстонский, азбука немых эстонская, азбука глухонемых эстонская, язык жестов - эстонский, жестовый эстонский язык
  • ← Вернуться

    ×
    Вступай в сообщество «hatewall.ru»!
    ВКонтакте:
    Я уже подписан на сообщество «hatewall.ru»