Анализ страницы https://simonwillison.net/tags/training-data/
Основное Готовность: 100%
Домен
simonwillison.net
Состояние доменного имени
?
Проверяем корректность доменного имени и наличие технических проблем на уровне домена.
Длина домена велика. Но если вы продвигаете запрос, входящий в название домена, то это хорошо.
Домен второго уровня идеален для продвижения.
Ответ сервера
200 Успешный ответ
HTTP-код ответа и цепочка редиректов
?
Код 200 — страница доступна. Коды 3xx — редиректы (цепочки замедляют загрузку и размывают ссылочный вес). Коды 4xx/5xx — ошибки, поисковик не сможет проиндексировать страницу.
Сервер настроен корректно.
Безопасность
Сайт безопасен
Использование HTTPS и SSL-сертификат
?
HTTPS — обязательный стандарт. Google и Яндекс отдают предпочтение защищённым сайтам. Отсутствие SSL или просроченный сертификат ведут к предупреждениям в браузере и снижению позиций.
Не настроен HSTS (Strict-Transport-Security) — рекомендуется включить.
На сайте работает защищенный протокол ssl и сайт открывается по https.
Ssl-сертификат действителен до 23.09.2026 16:48:15.
Сервер поддерживает HTTP/3 (QUIC) — новейший протокол.
Поздравляем! Сайт не содержится в реестре РКН.
Кодировка
utf-8
Кодировка символов страницы
?
Стандарт — UTF-8. Неправильная кодировка вызывает нечитаемые символы и мешает поисковику корректно распознать текст страницы.
Указана кодировка на странице utf-8.
Язык
en-gb
Атрибут lang в HTML-теге
?
Атрибут lang (<html lang="ru">) сообщает поисковикам и браузерам, на каком языке написана страница. Помогает при ранжировании в региональном поиске.
Язык документа указан явно: en-gb.
Скорость загрузки
~0,99сек
Время отклика сервера (TTFB)
?
Time To First Byte — время до получения первого байта от сервера. Норма до 200 мс. Медленный отклик ухудшает пользовательский опыт и ранжирование: Яндекс и Google учитывают скорость страниц.
Скорость загрузки сайта 0,99сек оптимальна.
Объем документа
103Кб
Размер HTML-кода страницы
?
Слишком большой HTML замедляет парсинг браузером и сканирование поисковым роботом. Рекомендуется не более 200 Кб.
Объем html-документа 103Кб оптимален.
Структура html-документа корректна.
Ресурсы
Ресурсы: 3
Внешние ресурсы страницы (CSS, JS, изображения)
?
Количество и тип подключённых ресурсов влияют на скорость загрузки. Большое число запросов увеличивает время рендеринга страницы.
Кол-во файлов ресурсов 3 достаточно.
Показать полный список ресурсов
| Тип | Название | Значение |
|---|---|---|
| stylesheet | text/css | /static/css/all.7977d7c44aeb.css |
| js | https://plausible.io/js/plausible.js | |
| js | module | https://static.cloudflareinsights.com/beacon.min.js/v4513226cdae34746b4dedf0b4dfa099e1781791509496 |
Серверные заголовки
Кол-во: 14
HTTP-заголовки ответа сервера
?
Заголовки сервера передают браузеру и поисковику служебную информацию: кеширование, безопасность (CSP, HSTS), сжатие (gzip). Правильная настройка ускоряет загрузку и повышает защищённость.
Найдены серверные заголовки 14шт. Подробнее про серверные заголовки.
Показать полный список серверных заголовков
| Ключ | Значение |
|---|---|
| Date | Fri, 21 Aug 2026 10:32:17 GMT |
| django-composition | Manoir de mes reves |
| nel | {"report_to":"heroku-nel","response_headers":["Via"],"max_age":3600,"success_fraction":0.01,"failure_fraction":0.1} |
| Referrer-Policy | strict-origin-when-cross-origin |
| report-to | {"group":"heroku-nel","endpoints":[{"url":"https://nel.heroku.com/reports?s=o3TuIEwtotGfkNyjEQiauhCPVm4CV9PTGinHjSGEE6k%3D\u0026sid=c46efe9b-d3d2-4a0c-8c76-bfafa16c5add\u0026ts=1787308337"}],"max_age":3600} |
| reporting-endpoints | heroku-nel="https://nel.heroku.com/reports?s=o3TuIEwtotGfkNyjEQiauhCPVm4CV9PTGinHjSGEE6k%3D&sid=c46efe9b-d3d2-4a0c-8c76-bfafa16c5add&ts=1787308337" |
| Server | cloudflare |
| Via | 1.1 heroku-router |
| X-Content-Type-Options | nosniff |
| Accept-Ranges | bytes |
| cf-cache-status | MISS |
| Server-Timing | cfCacheStatus;desc="MISS" |
| cf-ray | a2e8f914dd4c5325-HEL |
| Alt-Svc | h3=":443" |
CMS
Система управления сайтом (движок)
?
CMS — это движок, на котором работает сайт (WordPress, 1C-Bitrix, Tilda и др.). Знание CMS помогает понять возможности SEO-оптимизации и подобрать подходящие инструменты. «Не определена» — вероятно, самописный сайт или нестандартная сборка.
Сайт работает на CMS WordPress.
Веб-сервер
Программное обеспечение сервера
?
Веб-сервер — это ПО, которое отдаёт страницы посетителям (nginx, Apache, IIS, LiteSpeed и др.). Определяется по серверным заголовкам ответа (Server, X-Powered-By и т.п.). «Не определён» — сервер намеренно скрывает эти заголовки, это нормальная практика безопасности.
Сайт работает на веб-сервере Cloudflare.
Мета-теги Готовность: 48%
Title
Simon Willison on training-data
Заголовок страницы в браузере и поисковой выдаче
?
Title — главный SEO-заголовок страницы. Влияет на CTR в поиске и ранжирование. Оптимальная длина: 50–70 символов. Ключевые слова — ближе к началу.
Необходимо увеличить число символов в title (текущее значение: 31, оптимально: от 40 до 45)
Дублей словоформ в title не найдено.
Description
Описание страницы в поисковой выдаче (сниппет)
?
Meta Description — текст под заголовком в выдаче. Напрямую на позиции не влияет, но влияет на CTR. Оптимальная длина: 120–160 символов.
Установите мета-тег description!
Keywords
Список ключевых слов страницы (устаревший тег)
?
Meta Keywords не учитывается Яндексом и Google для ранжирования с 2009–2012 годов. Заполнение не обязательно, но не вредит. Конкурент может использовать содержимое для анализа.
Установите мета-тег keywords!
Канонический Url
https://simonwillison.net/tags/training-data/
Указывает поисковику основную версию страницы
?
Canonical (rel=canonical) предотвращает проблему дублей страниц. Должен точно совпадать с URL проверяемой страницы. Неправильный canonical может передать ссылочный вес на другую страницу.
Канонический Url прописан корректно.
Robots
Ошибок нет
Директивы для поисковых роботов на уровне страницы
?
Meta Robots управляет индексацией конкретной страницы: index/noindex — индексировать ли, follow/nofollow — следовать ли по ссылкам. Noindex полностью исключает страницу из поиска.
Meta-тег robots не указан. Страница свободна для индексации.
Адаптивность
width=device-width, initial-scale=1
Настройка масштабирования на мобильных устройствах
?
Тег viewport (<meta name="viewport">) сообщает браузеру, как масштабировать страницу на мобильных. Стандарт: width=device-width, initial-scale=1. Отсутствие — признак отсутствия мобильной версии.
Meta-тег viewport со значением-константой width=device-width задаёт ширину страницы в соответствии с размером экрана.
Meta-тег viewport со значением initial-scale=1.0 определяет масштаб 1:1, т.е. «не масштабировать».
Разметка OpenGraph
Кол-во: 5
Мета-теги для красивых превью в соцсетях
?
OpenGraph (og:title, og:description, og:image) управляет тем, как страница выглядит при репосте в социальных сетях и мессенджерах. Отсутствие OG-тегов — невзрачный превью при шеринге.
Разметка OpenGraph задана. Страница оптимизирована под социальные сети.
Показать полный список og мета-тегов
| Тип | Значение |
|---|---|
| og:site_name | Simon Willison’s Weblog |
| og:type | website |
| og:title | Simon Willison on training-data |
| og:description | 67 posts tagged ‘training-data’. Data used to train LLMs and other machine learning models. |
| og:site_name | Simon Willison’s Weblog |
Все мета-теги
Кол-во: 7
Полный список мета-тегов страницы
?
Таблица всех meta-тегов, включая нестандартные. Позволяет найти опечатки, дубли и лишние теги.
Найдены мета-теги 7шт. Мета-теги не видимы для человека и предназначены для обмена информацией между веб-страницей и поисковыми системами, браузерами и другими веб-службами. С ними роботы 🤖 и устройства ведут себя более ожидаемо.
Показать полный список мета-тегов
| Тип | Название | Значение |
|---|---|---|
| name | viewport | width=device-width, initial-scale=1 |
| name | author | Simon Willison |
| property | og:site_name | Simon Willison’s Weblog |
| property | og:type | website |
| property | og:title | Simon Willison on training-data |
| property | og:description | 67 posts tagged ‘training-data’. Data used to train LLMs and other machine learning models. |
| property | og:site_name | Simon Willison’s Weblog |
Оптимизация Готовность: 82%
Структура
Ошибок нет
Семантические HTML-элементы страницы
?
Проверяет наличие основных структурных элементов: nav, header, footer, main. Корректная семантическая структура помогает поисковику понять архитектуру страницы.
Структура документа корректна (теги <html> и <body> присутствуют в одном экземпляре).
Контент
Ошибок нет
Объём и качество текстового содержимого
?
Анализирует объём полезного текста на странице. Слишком мало — страница может считаться малополезной. Слишком много — ухудшается читаемость и восприятие.
Слова из title 3 встречаются в тексте достаточно.
Абзацев с текстом 257 достаточно.
Среднее число слов в абзаце 36 достаточно.
Кол-во знаков контента 55076 на странице оптимально.
Кол-во слов 9078 на странице оптимально.
Заголовки
Ошибок нет
Иерархия заголовков H1–H6
?
H1 должен быть один и содержать ключевой запрос. H2–H6 описывают подразделы. Пропуск уровней (H1 → H3) и несколько H1 — типичные ошибки, снижающие понятность страницы для поисковика.
На странице присутствуют заголовки <h1> 1. Это прекрасно.
На странице присутствуют заголовки <h2> 1. Это хорошо.
На странице присутствуют заголовки <h3> 5.
Тошнота
6,71
Насколько одно слово доминирует в тексте
?
Классическая тошнота = √(частота самого повторяющегося слова). Норма до 7–8: текст воспринимается естественно. Выше — поисковик может счесть страницу переспамленной.
Тошнота превышает норму 5. Измените текст страницы!
Академич. тошнота
27,76%
Насколько текст перенасыщен ключевыми словами
?
Академическая тошнота = (частота слова / общее количество слов) × 100%. Показывает долю конкретного слова в тексте. Норма 5–15%.
Академическая тошнота превышает норму 5-15%. Измените текст страницы!
Семантическое ядро
20
Наиболее часто встречающиеся слова на странице
?
Топ слов по частоте использования. Показывает, какие слова доминируют в тексте с точки зрения поисковика.
Контент страницы содержит осмысленный текст и слова.
Показать список слов
| Слово | Кол-во | Частота |
|---|---|---|
| models | 45 | 0,50% |
| training | 42 | 0,46% |
| training-data | 31 | 0,34% |
| generative-ai | 29 | 0,32% |
| trained | 29 | 0,32% |
| tokens | 25 | 0,28% |
| content | 20 | 0,22% |
| anthropic | 20 | 0,22% |
| ai-ethics | 15 | 0,17% |
| copyright | 15 | 0,17% |
| should | 13 | 0,14% |
| licensed | 13 | 0,14% |
| update | 13 | 0,14% |
| billion | 13 | 0,14% |
| copies | 12 | 0,13% |
| interesting | 11 | 0,12% |
| llm-release | 11 | 0,12% |
| released | 11 | 0,12% |
| corpus | 11 | 0,12% |
| synthetic | 11 | 0,12% |
Индексация Готовность: 0%
Индексирование
Есть ошибки
Разрешено ли индексирование страницы
?
Проверяет, не закрыта ли страница от индексации через robots.txt, meta robots или X-Robots-Tag. Страница, закрытая от индексации, не появится в поисковой выдаче.
Анкоров на странице 505 слишком много. Проведите ревизию и оптимизацию ссылок сайта.
Robots.txt
Найден корректный robots.txt
Файл управления сканированием сайта роботами
?
Robots.txt указывает поисковым роботам, какие страницы сканировать, а какие — нет. Ошибки в файле могут случайно закрыть важные разделы от индексации.
Robots.txt настроен корректно. Размер файла: 136 байт. Загружен за: 77мсек.
Проверяемая страница не запрещена в robots.txt.
Robots.txt доступен по постоянному адресу
Показать содержимое robots.txt
User-agent: ChatGPT-User
Disallow:
User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://simonwillison.net/sitemap.xml
Sitemap
Кол-во: 1
XML-карта сайта для поисковиков
?
Sitemap.xml помогает поисковику быстрее находить и индексировать страницы. Особенно важен для крупных сайтов и новых страниц, на которые ещё нет входящих ссылок.
Robots.txt содержит карту сайта. Это прекрасно!
Robots.txt не содержит ошибок в карте сайта.
Показать карту сайта
| Url | Статус |
|---|---|
| https://simonwillison.net/sitemap.xml |
|
Внутренние ссылки
Кол-во: 365
Ссылки на другие страницы своего сайта
?
Внутренние ссылки распределяют ссылочный вес между страницами и помогают поисковику обходить сайт. Пустые анкоры и ссылки на запрещённые robots.txt страницы — типичные ошибки.
Внутренних ссылок на странице 365 слишком много. Проведите оптимизацию сайта!
Внутренние ссылки не запрещены к индексации в robots.txt.
На странице присутствуют изображения 1.
Показать первые 100 внутренних ссылок
| Url | Анкор | Состояние |
|---|---|---|
| / |
Simon Willison’s Weblog
|
|
| /random/training-data/ |
<svg xmlns="http://www.w3.org/2000/svg" width="14" height="14" viewbox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round">
<rect x="3" y="3" width="18" height="18" rx="2"></rect>
<circle cx="8.5" cy="8.5" r="1.5" fill="currentColor" stroke="none"></circle>
<circle cx="15.5" cy="8.5" r="1.5" fill="currentColor" stroke="none"></circle>
<circle cx="8.5" cy="15.5" r="1.5" fill="currentColor" stroke="none"></circle>
<circle cx="15.5" cy="15.5" r="1.5" fill="currentColor" stroke="none"></circle>
<circle cx="12" cy="12" r="1.5" fill="currentColor" stroke="none"></circle>
</svg>
Random
|
|
| /2025/Jun/24/anthropic-training/ |
my previous coverage
|
|
| /2026/Aug/17/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-tra/ |
#
|
|
| /2026/Aug/17/ |
17th August 2026
|
|
| /2026/Aug/17/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-tra/ |
3:21 pm
|
|
| /tags/amazon/ |
amazon
|
|
| /tags/journalism/ |
journalism
|
|
| /tags/ai/ |
ai
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/ai-ethics/ |
ai-ethics
|
|
| /tags/404-media/ |
404-media
|
|
| /2026/Jul/20/afraid-of-chinese-models/ |
#
|
|
| /2026/Jul/20/ |
20th July 2026
|
|
| /2026/Jul/20/afraid-of-chinese-models/ |
5:09 pm
|
|
| /tags/ai/ |
ai
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/qwen/ |
qwen
|
|
| /tags/pelican-riding-a-bicycle/ |
pelican-riding-a-bicycle
|
|
| /tags/ai-ethics/ |
ai-ethics
|
|
| /tags/llm-release/ |
llm-release
|
|
| /tags/ai-in-china/ |
ai-in-china
|
|
| /2026/Jul/16/inkling/ |
#
|
|
| /2026/Jul/16/ |
16th July 2026
|
|
| /2026/Jul/16/inkling/ |
3:35 pm
|
|
| /tags/ai/ |
ai
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/pelican-riding-a-bicycle/ |
pelican-riding-a-bicycle
|
|
| /tags/llm-release/ |
llm-release
|
|
| /2026/Jun/2/microsofts-new-models/ |
#
|
|
| /2026/Jun/2/ |
2nd June 2026
|
|
| /2026/Jun/2/microsofts-new-models/ |
10:21 pm
|
|
| /tags/microsoft/ |
microsoft
|
|
| /tags/ai/ |
ai
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/llm-release/ |
llm-release
|
|
| /2026/Mar/30/mr-chatterbox/ |
wrote about Mr. Chatterbox
|
|
| /2026/Apr/28/talkie/ |
#
|
|
| /2026/Apr/28/ |
28th April 2026
|
|
| /2026/Apr/28/talkie/ |
2:47 am
|
|
| /tags/ai/ |
ai
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/local-llms/ |
local-llms
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/ai-ethics/ |
ai-ethics
|
|
| /tags/llm-release/ |
llm-release
|
|
| /tags/pelican-riding-a-bicycle/ |
I've published
|
|
| /2026/Apr/21/scosman/ |
#
|
|
| /2026/Apr/21/ |
21st April 2026
|
|
| /2026/Apr/21/scosman/ |
3:54 pm
|
|
| /tags/ai/ |
ai
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/pelican-riding-a-bicycle/ |
pelican-riding-a-bicycle
|
|
| /2026/Mar/30/mr-chatterbox/ |
Mr. Chatterbox is a (weak) Victorian-era ethically trained model you can run on your own computer
|
|
| /2026/Mar/30/mr-chatterbox/ |
952 words
|
|
| /2026/Mar/30/mr-chatterbox/ |
2:28 pm
|
|
| /2026/Mar/30/ |
30th March 2026
|
|
| /tags/ai/ |
ai
|
|
| /tags/andrej-karpathy/ |
andrej-karpathy
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/local-llms/ |
local-llms
|
|
| /tags/llms/ |
llms
|
|
| /tags/ai-assisted-programming/ |
ai-assisted-programming
|
|
| /tags/hugging-face/ |
hugging-face
|
|
| /tags/llm/ |
llm
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/uv/ |
uv
|
|
| /tags/ai-ethics/ |
ai-ethics
|
|
| /tags/claude-code/ |
claude-code
|
|
| /2025/Dec/27/john-cena/ |
#
|
|
| /2025/Dec/27/ |
27th December 2025
|
|
| /2025/Dec/27/john-cena/ |
3:43 pm
|
|
| /tags/tv/ |
tv
|
|
| /tags/ai/ |
ai
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/ai-ethics/ |
ai-ethics
|
|
| /2025/Oct/13/nanochat/ |
#
|
|
| /2025/Oct/13/ |
13th October 2025
|
|
| /2025/Oct/13/nanochat/ |
8:29 pm
|
|
| /tags/python/ |
python
|
|
| /tags/ai/ |
ai
|
|
| /tags/rust/ |
rust
|
|
| /tags/pytorch/ |
pytorch
|
|
| /tags/andrej-karpathy/ |
andrej-karpathy
|
|
| /tags/generative-ai/ |
generative-ai
|
|
| /tags/llms/ |
llms
|
|
| /tags/training-data/ |
training-data
|
|
| /tags/uv/ |
uv
|
|
| /tags/gpus/ |
gpus
|
|
Внешние ссылки
Кол-во: 132
Ссылки на сторонние сайты
?
Исходящие внешние ссылки передают часть ссылочного веса на чужие сайты. Ссылки на авторитетные ресурсы безопасны; ссылки на мусорные сайты могут навредить репутации страницы.
Внешних ссылок на странице 132 слишком много. Спрячьте лишние ссылки в тег noindex или атрибут rel='nofollow'!
На странице присутствуют ссылки на субдомены 1.
Показать первые 100 внешних ссылок
| Url | Анкор |
|---|---|
| 10xn.link |
auth.md
|
| 10xn.link |
Try it!
|
| 404media.co |
We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility
|
| maps.app.goo.gl |
LAS8 Amazon facility
|
| stratechery.com |
Who’s Afraid of Chinese Models?
|
| daringfireball.net |
via
|
| qwen.ai |
not to release Qwen 3.7 Max
|
| english.scio.gov.cn |
recent speech
|
| twitter.com |
Qwen 3.8 Max
|
| thinkingmachines.ai |
Inkling: Our open-weights model
|
| news.ycombinator.com |
via
|
| thinkingmachines.ai |
model card
|
| thinkingmachines.ai |
Training Data Documentation
|
| thinkingmachines.ai |
Tinker training platform
|
| gist.github.com |
response here
|
| gist.github.com |
the full response
|
| microsoft.ai |
announced two new text LLMs
|
| microsoft.ai |
MAI-Thinking-1
|
| microsoft.ai |
MAI-Code-1-Flash
|
| microsoft.ai |
of note
|
| microsoft.ai |
MAI-Code-1-Flash
|
| microsoft.ai |
model card for MAI-Code-1-Flash
|
| microsoft.ai |
MAI-Thinking-1 technical paper
|
| talkie-lm.com |
Introducing talkie: a 13B vintage language model from 1930
|
| news.ycombinator.com |
via
|
| nlevine.org |
Nick Levine
|
| cs.toronto.edu |
David Duvenaud
|
| en.wikipedia.org |
Alec Radford
|
| huggingface.co |
talkie-1930-13b-base
|
| huggingface.co |
talkie-1930-13b-it
|
| talkie-lm.com |
try that out here
|
| twitter.com |
Nick Levine on Twitter
|
| github.com |
Python programs
|
| github.com |
scosman/pelicans_riding_bicycles
|
| news.ycombinator.com |
via
|
| estragon.news |
Mr. Chatterbox
|
| huggingface.co |
the model card
|
| m.imdb.com |
Pluribus
|
| github.com |
nanochat
|
| twitter.com |
via
|
| github.com |
in this discussion post
|
| github.com |
training the tokenizer
|
| twitter.com |
almost coherent example here
|
| huggingface.co |
karpathy/fineweb-edu-100b-shuffle
|
| huggingface.co |
FineWeb-Edu
|
| github.com |
midtrains
|
| huggingface.co |
SmolTalk
|
| huggingface.co |
MMLU auxiliary train
|
| huggingface.co |
GSM8K
|
| github.com |
supervised finetuning
|
| huggingface.co |
ARC-Easy
|
| huggingface.co |
ARC-Challenge
|
| huggingface.co |
GSM8K
|
| huggingface.co |
SmolTalk
|
| github.com |
web server
|
| github.com |
HTML+JavaScript frontend
|
| huggingface.co |
sdobson/nanochat
|
| gist.github.com |
this script
|
| theverge.com |
Anthropic to pay $1.5 billion to authors in landmark AI settlement
|
| anthropiccopyrightsettlement.com |
www.anthropiccopyrightsettlement.com
|
| theatlantic.com |
a search engine
|
| oreilly.com |
The Art & Science of JavaScript
|
| secure.anthropiccopyrightsettlement.com |
now search for affected titles
|
| washingtonpost.com |
Washington Post story
|
| documentcloud.org |
this section
|
| theverge.com |
Reddit will block the Internet Archive
|
| qwenlm.github.io |
Qwen-Image: Crafting with Native Text Rendering
|
| x.com |
via
|
| huggingface.co |
Hugging Face repo
|
| qianwen-res.oss-cn-beijing.aliyuncs.com |
detailed technical report
|
| modelscope.cn |
ModelScope demo
|
| github.com |
not yet been released
|
| huggingface.co |
common-pile/caselaw_access_project
|
| x.com |
via
|
| huggingface.co |
the Common Pile
|
| theverge.com |
Anthropic wins a major fair use victory for AI — but it’s still in trouble for stealing books
|
| documentcloud.org |
judgement itself
|
| en.wikipedia.org |
William Haskell Alsup
|
| wired.com |
Disney and Universal Sue AI Company Midjourney for Copyright Infringement
|
| wired.com |
dozens of copyright lawsuits
|
| wired.com |
against Midjourney
|
| documentcloud.org |
the lawsuit on Document Cloud
|
| allenai.org |
7B and 13B models released in November
|
| allenai.org |
Ai2
|
| hansard.parliament.uk |
Baroness Kidron’s speech regarding UK AI legislation
|
| twitter.com |
via
|
| en.wikipedia.org |
Baroness Kidron
|
| parliamentlive.tv |
watch the video on parliamentlive.tv
|
| theguardian.com |
would provide a copyright exemption for AI training
|
| x.com |
to Ed Newton-Rex
|
| gov.uk |
this Copyright and AI: Consultation document
|
| lesswrong.com |
gwern
|
| adweek.com |
by Adweek
|
| niemanlab.org |
Rasmus Kleis Nielsen
|
| github.com |
DeepSeek_V3.pdf
|
| twitter.com |
via
|
| github.com |
model card
|
| huggingface.co |
trained on 11x that
|
| twitter.com |
Andrej Karpathy
|
| twitter.com |
announced their API pricing
|
Конкуренты Готовность: 0%
Конкуренты в Яндексе
Кол-во: 0
Топ сайтов-конкурентов в Яндексе
?
Сайты, чаще всего появляющиеся в ТОПе Яндекса по запросам из семантического ядра этой страницы.
Мы не нашли у вас конкурентов в Яндексе. Сайт или очень молодой или плохо продвигается.
Конкурентов в ТОП-10 Яндекса не нашлось.
Конкуренты в Google
Кол-во: 0
Топ сайтов-конкурентов в Google
?
Сайты, чаще всего появляющиеся в ТОПе Google по запросам из семантического ядра этой страницы.
Конкуренты в Google тоже не найдены. Займитесь продвижением сайта!
Конкурентов в ТОП-10 Google не нашлось.
ЗоЗПП: права потребителей Готовность: 100%
Нарушения
Не выявлены
Признаков дистанционной продажи товаров (интернет-магазина) не обнаружено — требования ЗоЗПП о раскрытии информации продавца к сайту не применяются. Нарушений нет.
ФЗ-149: рекомендательные технологии Готовность: 100%
Нарушения
Не выявлены
Рекомендательные блоки («с этим покупают», «похожие товары» и т.п.) на сайте не обнаружены — требования ст. 10.7 ФЗ-149 к сайту не применяются. Нарушений нет.
ФЗ-38: реклама Готовность: 100%
Нарушения
Не выявлены
Рекламных тематик с обязательными оговорками (медицина, БАД, кредиты и займы, новостройки) на сайте не обнаружено. Нарушений нет.
ФЗ-436: защита детей Готовность: 100%
Нарушения
Не выявлены
Признаков информационной продукции (новости, видео, книги, игры, курсы) не обнаружено — обязательная возрастная маркировка по ФЗ-436 сайту не требуется. Нарушений нет.
Вердикт
Страница https://simonwillison.net/tags/training-data/ готова к продвижению на 58%. Чтобы еще улучшить страницу и попасть на первые места поисковой выдачи необходимо:
Исправьте ошибки в мета-тегах.
Исправьте ошибки индексации.
Поделитесь с друзьями: