Анализ страницы https://www.tidytextmining.com/dtm
Основное Готовность: 75%
Домен
tidytextmining.com
Состояние доменного имени
?
Проверяем корректность доменного имени и наличие технических проблем на уровне домена.
Длина домена велика. Но если вы продвигаете запрос, входящий в название домена, то это хорошо.
Домен второго уровня идеален для продвижения.
Ответ сервера
200 Успешный ответ
HTTP-код ответа и цепочка редиректов
?
Код 200 — страница доступна. Коды 3xx — редиректы (цепочки замедляют загрузку и размывают ссылочный вес). Коды 4xx/5xx — ошибки, поисковик не сможет проиндексировать страницу.
Сервер настроен корректно.
Безопасность
Сайт безопасен
Использование HTTPS и SSL-сертификат
?
HTTPS — обязательный стандарт. Google и Яндекс отдают предпочтение защищённым сайтам. Отсутствие SSL или просроченный сертификат ведут к предупреждениям в браузере и снижению позиций.
На сайте работает защищенный протокол ssl и сайт открывается по https.
Ssl-сертификат действителен до 09.01.2027 2:59:59.
Включён HSTS (Strict-Transport-Security) — защита от подмены на http.
Поздравляем! Сайт не содержится в реестре РКН.
Кодировка
utf-8
Кодировка символов страницы
?
Стандарт — UTF-8. Неправильная кодировка вызывает нечитаемые символы и мешает поисковику корректно распознать текст страницы.
Указана кодировка на странице utf-8.
Язык
en
Атрибут lang в HTML-теге
?
Атрибут lang (<html lang="ru">) сообщает поисковикам и браузерам, на каком языке написана страница. Помогает при ранжировании в региональном поиске.
Язык документа указан явно: en.
Скорость загрузки
~0,66сек
Время отклика сервера (TTFB)
?
Time To First Byte — время до получения первого байта от сервера. Норма до 200 мс. Медленный отклик ухудшает пользовательский опыт и ранжирование: Яндекс и Google учитывают скорость страниц.
Скорость загрузки сайта 0,66сек оптимальна.
Объем документа
88Кб
Размер HTML-кода страницы
?
Слишком большой HTML замедляет парсинг браузером и сканирование поисковым роботом. Рекомендуется не более 200 Кб.
Объем html-документа 88Кб оптимален.
Структура html-документа корректна.
Ресурсы
Ресурсы: 14
Внешние ресурсы страницы (CSS, JS, изображения)
?
Количество и тип подключённых ресурсов влияют на скорость загрузки. Большое число запросов увеличивает время рендеринга страницы.
Кол-во файлов ресурсов 14 много для одной страницы. Приемлемо до 10. Проведите оптимизацию файлов ресурсов!
Показать полный список ресурсов
| Тип | Название | Значение |
|---|---|---|
| stylesheet | libs/bootstrap-4.6.0/bootstrap.min.css | |
| stylesheet | libs/Roboto-0.4.9/font.css | |
| stylesheet | libs/bs4_book-1.0.0/bs4_book.css | |
| js | https://cdnjs.cloudflare.com/ajax/libs/clipboard.js/2.0.6/clipboard.min.js | |
| js | https://cdnjs.cloudflare.com/ajax/libs/fuse.js/6.4.6/fuse.js | |
| js | https://kit.fontawesome.com/6ecbd6c532.js | |
| js | libs/jquery-3.6.0/jquery-3.6.0.min.js | |
| js | libs/bootstrap-4.6.0/bootstrap.bundle.min.js | |
| js | libs/bs3compat-0.9.0/transition.js | |
| js | libs/bs3compat-0.9.0/tabs.js | |
| js | libs/bs3compat-0.9.0/bs3compat.js | |
| js | libs/bs4_book-1.0.0/bs4_book.js | |
| js | https://cdnjs.cloudflare.com/ajax/libs/autocomplete.js/0.38.0/autocomplete.jquery.min.js | |
| js | https://cdnjs.cloudflare.com/ajax/libs/mark.js/8.11.1/mark.min.js |
Серверные заголовки
Кол-во: 10
HTTP-заголовки ответа сервера
?
Заголовки сервера передают браузеру и поисковику служебную информацию: кеширование, безопасность (CSP, HSTS), сжатие (gzip). Правильная настройка ускоряет загрузку и повышает защищённость.
Найдены серверные заголовки 10шт. Подробнее про серверные заголовки.
Показать полный список серверных заголовков
| Ключ | Значение |
|---|---|
| Accept-Ranges | bytes |
| Age | 0 |
| Cache-Control | public, must-revalidate, max-age=0 |
| cache-status | "Netlify Edge"; fwd=miss; fwd-status=200; stored |
| Date | Sat, 22 Aug 2026 03:55:15 GMT |
| ETag | "bd1228d4e750dd7cba8c58c4af6dd03c-ssl" |
| Server | Netlify |
| Strict-Transport-Security | max-age=31536000 |
| Vary | Accept-Encoding |
| x-nf-request-id | 01M0KSQHB9FPMHYE6AQFVCTS1V |
CMS
bookdown 0.42 with bs4_book()
Система управления сайтом (движок)
?
CMS — это движок, на котором работает сайт (WordPress, 1C-Bitrix, Tilda и др.). Знание CMS помогает понять возможности SEO-оптимизации и подобрать подходящие инструменты. «Не определена» — вероятно, самописный сайт или нестандартная сборка.
В мета-теге generator указано: bookdown 0.42 with bs4_book().
Веб-сервер
Netlify
Программное обеспечение сервера
?
Веб-сервер — это ПО, которое отдаёт страницы посетителям (nginx, Apache, IIS, LiteSpeed и др.). Определяется по серверным заголовкам ответа (Server, X-Powered-By и т.п.). «Не определён» — сервер намеренно скрывает эти заголовки, это нормальная практика безопасности.
В заголовке Server указано: Netlify.
Мета-теги Готовность: 48%
Title
5 Converting to and from non-tidy formats | Text Mining with R
Заголовок страницы в браузере и поисковой выдаче
?
Title — главный SEO-заголовок страницы. Влияет на CTR в поиске и ранжирование. Оптимальная длина: 50–70 символов. Ключевые слова — ближе к началу.
Необходимо уменьшить число символов в title (текущее значение: 62, оптимально: от 40 до 45)
Дублей словоформ в title не найдено.
Description
In the previous chapters, we’ve been analyzing text arranged in the tidy text format: a table with one-token-per-document-per-row, such as is constructed by the unnest_tokens() function. This lets...
Описание страницы в поисковой выдаче (сниппет)
?
Meta Description — текст под заголовком в выдаче. Напрямую на позиции не влияет, но влияет на CTR. Оптимальная длина: 120–160 символов.
Необходимо уменьшить число символов в description (текущее значение: 199, оптимально: от 120 до 130)
Keywords
Список ключевых слов страницы (устаревший тег)
?
Meta Keywords не учитывается Яндексом и Google для ранжирования с 2009–2012 годов. Заполнение не обязательно, но не вредит. Конкурент может использовать содержимое для анализа.
Установите мета-тег keywords!
Канонический Url
Указывает поисковику основную версию страницы
?
Canonical (rel=canonical) предотвращает проблему дублей страниц. Должен точно совпадать с URL проверяемой страницы. Неправильный canonical может передать ссылочный вес на другую страницу.
Рекомендуем прописать канонический Url.
Robots
Ошибок нет
Директивы для поисковых роботов на уровне страницы
?
Meta Robots управляет индексацией конкретной страницы: index/noindex — индексировать ли, follow/nofollow — следовать ли по ссылкам. Noindex полностью исключает страницу из поиска.
Meta-тег robots не указан. Страница свободна для индексации.
Адаптивность
width=device-width, initial-scale=1, shrink-to-fit=no
Настройка масштабирования на мобильных устройствах
?
Тег viewport (<meta name="viewport">) сообщает браузеру, как масштабировать страницу на мобильных. Стандарт: width=device-width, initial-scale=1. Отсутствие — признак отсутствия мобильной версии.
Meta-тег viewport со значением-константой width=device-width задаёт ширину страницы в соответствии с размером экрана.
Meta-тег viewport со значением initial-scale=1.0 определяет масштаб 1:1, т.е. «не масштабировать».
Разметка OpenGraph
Кол-во: 5
Мета-теги для красивых превью в соцсетях
?
OpenGraph (og:title, og:description, og:image) управляет тем, как страница выглядит при репосте в социальных сетях и мессенджерах. Отсутствие OG-тегов — невзрачный превью при шеринге.
Разметка OpenGraph задана. Страница оптимизирована под социальные сети.
Показать полный список og мета-тегов
| Тип | Значение |
|---|---|
| og:title | 5 Converting to and from non-tidy formats | Text Mining with R |
| og:type | book |
| og:url | https://www.tidytextmining.com/dtm.html |
| og:image | https://www.tidytextmining.com/images/cover.png |
| og:description | In the previous chapters, we’ve been analyzing text arranged in the tidy text format: a table with one-token-per-document-per-row, such as is constructed by the unnest_tokens() function. This lets... |
Все мета-теги
Кол-во: 14
Полный список мета-тегов страницы
?
Таблица всех meta-тегов, включая нестандартные. Позволяет найти опечатки, дубли и лишние теги.
Найдены мета-теги 14шт. Мета-теги не видимы для человека и предназначены для обмена информацией между веб-страницей и поисковыми системами, браузерами и другими веб-службами. С ними роботы 🤖 и устройства ведут себя более ожидаемо.
Показать полный список мета-тегов
| Тип | Название | Значение |
|---|---|---|
| name | viewport | width=device-width, initial-scale=1, shrink-to-fit=no |
| name | author | Julia Silge and David Robinson |
| name | description | In the previous chapters, we’ve been analyzing text arranged in the tidy text format: a table with one-token-per-document-per-row, such as is constructed by the unnest_tokens() function. This lets... |
| name | generator | bookdown 0.42 with bs4_book() |
| name | twitter:card | summary |
| name | twitter:title | 5 Converting to and from non-tidy formats | Text Mining with R |
| name | twitter:description | In the previous chapters, we’ve been analyzing text arranged in the tidy text format: a table with one-token-per-document-per-row, such as is constructed by the unnest_tokens() function. This lets... |
| name | twitter:image | https://www.tidytextmining.com/images/cover.png |
| name | viewport | width=device-width, initial-scale=1, shrink-to-fit=no |
| property | og:title | 5 Converting to and from non-tidy formats | Text Mining with R |
| property | og:type | book |
| property | og:url | https://www.tidytextmining.com/dtm.html |
| property | og:image | https://www.tidytextmining.com/images/cover.png |
| property | og:description | In the previous chapters, we’ve been analyzing text arranged in the tidy text format: a table with one-token-per-document-per-row, such as is constructed by the unnest_tokens() function. This lets... |
Оптимизация Готовность: 82%
Структура
Ошибок нет
Семантические HTML-элементы страницы
?
Проверяет наличие основных структурных элементов: nav, header, footer, main. Корректная семантическая структура помогает поисковику понять архитектуру страницы.
Структура документа корректна (теги <html> и <body> присутствуют в одном экземпляре).
Контент
Ошибок нет
Объём и качество текстового содержимого
?
Анализирует объём полезного текста на странице. Слишком мало — страница может считаться малополезной. Слишком много — ухудшается читаемость и восприятие.
Слова из title 11 встречаются в тексте достаточно.
Абзацев с текстом 61 достаточно.
Среднее число слов в абзаце 40 достаточно.
Кол-во знаков контента 27603 на странице оптимально.
Кол-во слов 4892 на странице оптимально.
Заголовки
Ошибок нет
Иерархия заголовков H1–H6
?
H1 должен быть один и содержать ключевой запрос. H2–H6 описывают подразделы. Пропуск уровней (H1 → H3) и несколько H1 — типичные ошибки, снижающие понятность страницы для поисковика.
На странице присутствуют заголовки <h1> 2. Это прекрасно.
На странице присутствуют заголовки <h2> 6. Это хорошо.
На странице присутствуют заголовки <h3> 3.
Тошнота
5,29
Насколько одно слово доминирует в тексте
?
Классическая тошнота = √(частота самого повторяющегося слова). Норма до 7–8: текст воспринимается естественно. Выше — поисковик может счесть страницу переспамленной.
Тошнота превышает норму 5. Измените текст страницы!
Академич. тошнота
24,41%
Насколько текст перенасыщен ключевыми словами
?
Академическая тошнота = (частота слова / общее количество слов) × 100%. Показывает долю конкретного слова в тексте. Норма 5–15%.
Академическая тошнота превышает норму 5-15%. Измените текст страницы!
Семантическое ядро
20
Наиболее часто встречающиеся слова на странице
?
Топ слов по частоте использования. Показывает, какие слова доминируют в тексте с точки зрения поисковика.
Контент страницы содержит осмысленный текст и слова.
Показать список слов
| Слово | Кол-во | Частота |
|---|---|---|
| negative | 28 | 0,57% |
| document | 25 | 0,51% |
| positive | 25 | 0,51% |
| corpus | 21 | 0,43% |
| sentiment | 20 | 0,41% |
| articles | 20 | 0,41% |
| matrix | 19 | 0,39% |
| package | 18 | 0,37% |
| company | 18 | 0,37% |
| figure | 16 | 0,33% |
| microsoft | 15 | 0,31% |
| 14 | 0,29% | |
| mining | 13 | 0,27% |
| analysis | 13 | 0,27% |
| objects | 13 | 0,27% |
| financial | 13 | 0,27% |
| example | 13 | 0,27% |
| packages | 12 | 0,25% |
| chapter | 12 | 0,25% |
| document-term | 12 | 0,25% |
Индексация Готовность: 0%
Индексирование
Есть ошибки
Разрешено ли индексирование страницы
?
Проверяет, не закрыта ли страница от индексации через robots.txt, meta robots или X-Robots-Tag. Страница, закрытая от индексации, не появится в поисковой выдаче.
Анкоров на странице 272 слишком много. Проведите ревизию и оптимизацию ссылок сайта.
Robots.txt
Не найден
Файл управления сканированием сайта роботами
?
Robots.txt указывает поисковым роботам, какие страницы сканировать, а какие — нет. Ошибки в файле могут случайно закрыть важные разделы от индексации.
Файл robots.txt не найден (ошибка 404). Крайне рекомендуем добавить файл robots.txt, это правило хорошего тона для поисковых роботов.
Sitemap
Кол-во: 0
XML-карта сайта для поисковиков
?
Sitemap.xml помогает поисковику быстрее находить и индексировать страницы. Особенно важен для крупных сайтов и новых страниц, на которые ещё нет входящих ссылок.
Robots.txt не содержит ссылку на карту сайта. Рекомендуется добавить карту сайта и указать ссылку на нее в robots.txt.
Внутренние ссылки
Кол-во: 15
Ссылки на другие страницы своего сайта
?
Внутренние ссылки распределяют ссылочный вес между страницами и помогают поисковику обходить сайт. Пустые анкоры и ссылки на запрещённые robots.txt страницы — типичные ошибки.
Внутренних ссылок на странице 15 оптимально.
Показать внутренние ссылки
| Url | Анкор | Состояние |
|---|---|---|
| / |
Text Mining with R
|
|
| / |
Welcome to Text Mining with R
|
|
| /preface |
Preface
|
|
| /tidytext |
<span class="header-section-number">1</span> The tidy text format
|
|
| /sentiment |
<span class="header-section-number">2</span> Sentiment analysis with tidy data
|
|
| /tfidf |
<span class="header-section-number">3</span> Analyzing word and document frequency: tf-idf
|
|
| /ngrams |
<span class="header-section-number">4</span> Relationships between words: n-grams and correlations
|
|
| /dtm |
<span class="header-section-number">5</span> Converting to and from non-tidy formats
|
|
| /topicmodeling |
<span class="header-section-number">6</span> Topic modeling
|
|
|
<span class="header-section-number">7</span> Case study: comparing Twitter archives
|
|
|
| /nasa |
<span class="header-section-number">8</span> Case study: mining NASA metadata
|
|
| /usenet |
<span class="header-section-number">9</span> Case study: analyzing usenet text
|
|
| /references |
<span class="header-section-number">10</span> References
|
|
| /ngrams |
<span class="header-section-number">4</span> Relationships between words: n-grams and correlations
|
|
| /topicmodeling |
<span class="header-section-number">6</span> Topic modeling
|
|
Внешние ссылки
Кол-во: 221
Ссылки на сторонние сайты
?
Исходящие внешние ссылки передают часть ссылочного веса на чужие сайты. Ссылки на авторитетные ресурсы безопасны; ссылки на мусорные сайты могут навредить репутации страницы.
Внешних ссылок на странице 221 слишком много. Спрячьте лишние ссылки в тег noindex или атрибут rel='nofollow'!
Показать первые 100 внешних ссылок
| Url | Анкор |
|---|---|
| github.com |
View book source <i class="fab fa-github"></i>
|
| juliasilge.github.io |
unnest_tokens()
|
| cran.r-project.org |
CRAN Task View for Natural Language Processing
|
| en.wikipedia.org |
document-term matrix
|
| generics.r-lib.org |
tidy()
|
| juliasilge.github.io |
cast_sparse()
|
| juliasilge.github.io |
cast_dtm()
|
| juliasilge.github.io |
cast_dfm()
|
| rdrr.io |
library
|
| tm.r-forge.r-project.org |
tm
|
| rdrr.io |
data
|
| rdrr.io |
Terms()
|
| rdrr.io |
Terms
|
| rdrr.io |
head
|
| generics.r-lib.org |
tidy()
|
| rdrr.io |
library
|
| dplyr.tidyverse.org |
dplyr
|
| rdrr.io |
library
|
| juliasilge.github.io |
tidytext
|
| generics.r-lib.org |
tidy
|
| rdrr.io |
melt()
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
inner_join
|
| juliasilge.github.io |
get_sentiments
|
| rdrr.io |
c
|
| rdrr.io |
library
|
| ggplot2.tidyverse.org |
ggplot2
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
count
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
filter
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
mutate
|
| rdrr.io |
ifelse
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
mutate
|
| rdrr.io |
reorder
|
| magrittr.tidyverse.org |
%>%
|
| ggplot2.tidyverse.org |
ggplot
|
| ggplot2.tidyverse.org |
aes
|
| ggplot2.tidyverse.org |
geom_col
|
| ggplot2.tidyverse.org |
labs
|
| rdrr.io |
data
|
| magrittr.tidyverse.org |
%>%
|
| quanteda.io |
tokens
|
| magrittr.tidyverse.org |
%>%
|
| quanteda.io |
dfm
|
| generics.r-lib.org |
tidy
|
| juliasilge.github.io |
bind_tf_idf()
|
| magrittr.tidyverse.org |
%>%
|
| juliasilge.github.io |
bind_tf_idf
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
arrange
|
| dplyr.tidyverse.org |
desc
|
| juliasilge.github.io |
unnest_tokens()
|
| tidyr.tidyverse.org |
complete()
|
| rdrr.io |
library
|
| tidyr.tidyverse.org |
tidyr
|
| magrittr.tidyverse.org |
%>%
|
| tidyr.tidyverse.org |
extract
|
| magrittr.tidyverse.org |
%>%
|
| tidyr.tidyverse.org |
complete
|
| rdrr.io |
list
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
group_by
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
mutate
|
| rdrr.io |
sum
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
filter
|
| rdrr.io |
%in%
|
| rdrr.io |
c
|
| magrittr.tidyverse.org |
%>%
|
| ggplot2.tidyverse.org |
ggplot
|
| ggplot2.tidyverse.org |
aes
|
| ggplot2.tidyverse.org |
geom_point
|
| ggplot2.tidyverse.org |
geom_smooth
|
| ggplot2.tidyverse.org |
facet_wrap
|
| ggplot2.tidyverse.org |
scale_y_continuous
|
| scales.r-lib.org |
percent_format
|
| ggplot2.tidyverse.org |
labs
|
| juliasilge.github.io |
cast_dtm()
|
| magrittr.tidyverse.org |
%>%
|
| juliasilge.github.io |
cast_dtm
|
| juliasilge.github.io |
cast_dfm()
|
| magrittr.tidyverse.org |
%>%
|
| juliasilge.github.io |
cast_dfm
|
| rdrr.io |
library
|
| matrix.r-forge.r-project.org |
Matrix
|
| magrittr.tidyverse.org |
%>%
|
| juliasilge.github.io |
cast_sparse
|
| rdrr.io |
class
|
| rdrr.io |
dim
|
| rdrr.io |
library
|
| github.com |
janeaustenr
|
| rdrr.io |
austen_books
|
| magrittr.tidyverse.org |
%>%
|
| juliasilge.github.io |
unnest_tokens
|
| magrittr.tidyverse.org |
%>%
|
| dplyr.tidyverse.org |
count
|
Конкуренты Готовность: 0%
Конкуренты в Яндексе
Кол-во: 0
Топ сайтов-конкурентов в Яндексе
?
Сайты, чаще всего появляющиеся в ТОПе Яндекса по запросам из семантического ядра этой страницы.
Мы не нашли у вас конкурентов в Яндексе. Сайт или очень молодой или плохо продвигается.
Конкурентов в ТОП-10 Яндекса не нашлось.
Конкуренты в Google
Кол-во: 0
Топ сайтов-конкурентов в Google
?
Сайты, чаще всего появляющиеся в ТОПе Google по запросам из семантического ядра этой страницы.
Конкуренты в Google тоже не найдены. Займитесь продвижением сайта!
Конкурентов в ТОП-10 Google не нашлось.
ЗоЗПП: права потребителей Готовность: 100%
Нарушения
Не выявлены
Признаков дистанционной продажи товаров (интернет-магазина) не обнаружено — требования ЗоЗПП о раскрытии информации продавца к сайту не применяются. Нарушений нет.
ФЗ-149: рекомендательные технологии Готовность: 100%
Нарушения
Не выявлены
Рекомендательные блоки («с этим покупают», «похожие товары» и т.п.) на сайте не обнаружены — требования ст. 10.7 ФЗ-149 к сайту не применяются. Нарушений нет.
ФЗ-38: реклама Готовность: 100%
Нарушения
Не выявлены
Рекламных тематик с обязательными оговорками (медицина, БАД, кредиты и займы, новостройки) на сайте не обнаружено. Нарушений нет.
ФЗ-436: защита детей Готовность: 100%
Нарушения
Не выявлены
Признаков информационной продукции (новости, видео, книги, игры, курсы) не обнаружено — обязательная возрастная маркировка по ФЗ-436 сайту не требуется. Нарушений нет.
Вердикт
Страница https://www.tidytextmining.com/dtm готова к продвижению на 51%. Чтобы еще улучшить страницу и попасть на первые места поисковой выдачи необходимо:
Исправьте ошибки в мета-тегах.
Исправьте ошибки индексации.
Поделитесь с друзьями: