[Десктопный софт] A-Parser 1.1 - продвинутый парсер поисковых систем, Suggest, PR, DMOZ, Whois, etc

Видео урок: Создание JS парсеров. Работа с ReCaptcha2(https://a-parser.com/threads/4493/)

Очередное видео в цикле уроков по созданию JavaScript парсеров. Здесь показано, как реализовать разгадывание рекаптч в JS парсере.



В уроке рассмотрено:
  • Описание и настройка парсера
    util-recaptcha2.png
    Util::ReCaptcha2
  • Описание принципа работы ReCaptcha2
  • Создание кастомного JavaScript парсера с поддержкой разгадывания рекаптч

Ссылки:
  • Тестирование работы ReCaptcha2: http://http.myjino.ru/recaptcha/test-get.php[/url]
  • Статья и готовый парсер:https://a-parser.com/resources/259/[/url]

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!(https://www.youtube.com/c/AParser_channel)
 
Сборник рецептов #23: категории сайтов, парсинг в YML и преобразование дат

23-й сборник рецептов. В нем мы будем парсить категории сайтов из Google, научимся формировать файлы YML, а также разберемся, как парсить даты и преобразовывать их в единый формат. Поехали!

Получение категорий сайтов из Google [url=https://a-parser.com/resources/285/]

Категоризация сайтов - довольно актуальная задача, но существует немного сервисов, которые могут ее решить. Поэтому, по ссылке выше можно взять небольшой парсер, который позволяет получать категории сайтов из Google.


Выгрузка товаров в формате YML[url=https://a-parser.com/resources/284/]

YML - это стандарт, разработанный Яндексом для работы с Маркетом. По своей сути, это файлы, схожие с XML, в которых содержится информация о товарах в интернет-магазине. Данный формат обеспечивает регулярное автоматическое обновление каталога на Яндекс.Маркет и позволяет отражать все актуальные изменения (наличие, цена, появление новых товаров). Пример парсинга интернет-магазина и сохранения собранных данных в YML можно посмотреть по ссылке выше.


Парсим Google новости с датой и преобразуем ее[url=https://a-parser.com/resources/281/]

В поисковой выдаче Google возле новостей публикуется дата. Как правило, это могут быть метки "10 ч. назад" или "26 мая 2018 г.". Иногда может возникнуть задача спарсить все даты и привести их к единому виду. Как именно это сделать, можно узнать по ссылке выше.


Кроме этого:
  • Сохранение произвольных данных в сессиях - новый функционал по работе с сессиями [url=https://a-parser.com/resources/280/]
  • Сохранение больших файлов напрямую на диск - возможность сохранять файлы в JS парсерах напрямую, минуя шаблонизатор [url=https://a-parser.com/resources/279/]
Еще больше различных рецептов в нашем Каталоге! [url=https://a-parser.com/resources/]

Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы. [url=https://a-parser.com/threads/3464/]

Подписывайтесь на Наш канал на Youtube [url=https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw] - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter [url=https://twitter.com/a_parser].

Предыдущие сборники рецептов:
  • Сборник рецептов #1: Определяем CMS, оцениваем частотность ключевых слов и парсим Вконтакте [url=http://a-parser.com/threads/1250/]
  • Сборник рецептов #2: собираем форумы для XRumer, парсим email со страниц контактов [url=http://a-parser.com/threads/1328/]
  • Сборник рецептов #3: мобильные сайты, несколько парсеров, позиции ключевых слов [url=http://a-parser.com/threads/1660/]
  • Сборник рецептов #4: поиск в выдаче, парсинг интернет-магазина и скачиваем файлы [url=http://a-parser.com/threads/1674/]
  • Сборник рецептов #5: ссылки из JS, паблик прокси и карта сайта [url=http://a-parser.com/threads/1705/]
  • Сборник рецептов #6: парсим базу номеров телефонов и сохраняем результаты красиво [url=http://a-parser.com/threads/1737/]
  • Сборник рецептов #7: парсим RSS, качаем картинки и фильтруем результат по заголовкам [url=http://a-parser.com/threads/1778/]
  • Сборник рецептов #8: парсим 2GIS, Google translate и подсказки Youtube [url=http://a-parser.com/threads/1809/]
  • Сборник рецептов #9: проверяем сезонность ключевых слов и их полезность [url=http://a-parser.com/threads/1830/]
  • Сборник рецептов #10: пишем кастомный парсер поисковика и парсим дерево категорий [url=http://a-parser.com/threads/1881/]
  • Сборник рецептов #11: парсим Авито, работаем с JavaScript, анализируем тексты и участвуем в акции! [url=http://a-parser.com/threads/1938/]
  • Сборник рецептов #12: парсим Instagram, собираем статистику и делаем свои парсеры подсказок [url=http://a-parser.com/threads/2240/]
  • Сборник рецептов #13: сохраняем результат в файл дампа SQL и знакомимся с $tools.query [url=http://a-parser.com/threads/2460/]
  • Сборник рецептов #14: используем XPath, анализируем сайты и создаем комбинированные пресеты [url=http://a-parser.com/threads/2613/]
  • Сборник рецептов #15: анализируем скорость и юзабилити сайтов, парсим Яндекс.Картинки и Baidu [url=http://a-parser.com/threads/2712/]
  • Сборник рецептов #16: парсинг OpenSiteExplorer с авторизацией, Яндекс.Каталога и Яндекс.Новостей [url=https://a-parser.com/threads/2808/]
  • Сборник рецептов #17: картинки из Flickr, язык ключевых слов, список лайков в ВК [url=https://a-parser.com/threads/3544/]
  • Сборник рецептов #18: скриншоты сайтов, lite выдача Яндекса и проверка сайтов [url=https://a-parser.com/threads/3862/]
  • Сборник рецептов #19: публикация сообщений в Wordpress, парсинг Chrome Webstore и AliExpress [url=https://a-parser.com/threads/3910/]
  • Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов [url=https://a-parser.com/threads/4074/]
  • Сборник рецептов #21: уведомления в Telegram из A-Parser, мультифильтр и парсинг IMDb [url=https://a-parser.com/threads/4318/]
  • Сборник рецептов #22: проверка индексации в нескольких ПС, многоуровневый парсинг и поиск сабдоменов [url=https://a-parser.com/threads/4405/]
 
1.2.216 - улучшения в SE::Google::Modern и JS парсерах, а также множество других[https://a-parser.com/threads/4563/]

1.2.216.png


Улучшения
  • Зависимая задача в Цепочке заданий теперь запускается только когда файл результатов не пустой
  • Добавлен повтор без смены прокси при неудачной отправке рекаптчи в
    se-google.png
    SE::Google::Modern [https://a-parser.com/wiki/se-google-modern/]
  • Добавлен бан прокси при получении 403 кода ответа в
    se-google.png
    SE::Google::Modern [https://a-parser.com/wiki/se-google-modern/]
  • Процент неудачных запросов теперь отображается относительно числа выполненных запросов
  • Добавлена возможность вызвать URL после выполнения задания
  • Улучшен обзор каталогов при выборе файлов запросов
  • Добавлена поддержка setInterval в JavaScript парсерах
  • Уменьшено Wait between get status и улучшено логгирование в
    util-recaptcha2.png
    Util::ReCaptcha2 [https://a-parser.com/wiki/util-recaptcha2/]
  • Улучшена обработка редиректов
  • Добавлена защита от бесконечного выполнения в JavaScript парсерах
  • Значительно увеличены возможности check_content в JS парсерах
  • В ответе API метода info добавлены параметры workingTasks, activeThreads, activeProxyCheckerThreads
Исправления в связи с изменениями в выдаче
  • Исправлен парсинг рекламы в мобильной версии
    se-google.png
    SE::Google::Modern [https://a-parser.com/wiki/se-google-modern/]
  • Исправлен парсинг количества результатов в
    se-baidu.png
    SE::Baidu [https://a-parser.com/wiki/se-baidu/]
  • rank-majesticseo.png
    Rank::MajesticSEO [https://a-parser.com/wiki/rank-majesticseo/],
    se-google.png
    SE::Google::Modern [https://a-parser.com/wiki/se-google-modern/],
    se-google-trends.png
    SE::Google::Trends [https://a-parser.com/wiki/se-google-trends/]
Исправления
  • Исправлено ведение лога при нескольких паузах задания
  • Исправлена ошибка, из-за которой запрос считался неудачным при пустой выдаче в
    se-google.png
    SE::Google::Modern [https://a-parser.com/wiki/se-google-modern/]
  • Исправлена работа с url, содержащими фрагмент # в
    net-http.png
    Net::HTTP [https://a-parser.com/wiki/net-http/]
  • Исправлен парсинг ссылок в
    html-linkextractor.png
    HTML::LinkExtractor [https://a-parser.com/wiki/html-linkextractor/]
  • Исправлена работа опции Pages count в
    se-yandex.png
    SE::Yandex [https://a-parser.com/wiki/se-yandex/]
  • Исправлен выбор файлов запросов на Windows 10
  • Исправлена ошибка, из-за которой иногда нельзя было удалить файл с запросами
  • Исправлено отображение проксичекера в конфиге потоков
  • Исправлена кодировка некоторых результатов в
    se-google-suggest.png
    SE::Google::Suggest [https://a-parser.com/wiki/se-google-suggest/]
  • Исправлена ситуация, когда не читались настройки из config.txt
 
Сборник рецептов #24

Сборник рецептов #24: уведомление в Telegram об экспайре доменов, чекер РКН и работа с SQLite https://a-parser.com/threads/4591/

24-й сборник рецептов. В нем мы научимся мониторить окончание срока регистрации доменов с уведомлением в Телеграм, сделаем альтернативный чекер сайтов в базе РКН, а также на простом примере парсера курсов валют изучим работу с базами данных. Поехали!

Получаем уведомления в Telegram об окончании срока регистрации доменов [url=https://a-parser.com/resources/287/]

Мониторинг сроков регистрации доменов - это довольно распространенная задача. A-Parser позволяет легко автоматизировать этот процесс. Более того, можно настроить получение прямо в Телеграм уведомлений о доменах, срок регистрации которых скоро закончится. Готовое решение для автоматической проверки с уведомлением - по ссылке выше.


Проверка блокировки РосКомНадзора через GitHub [url=https://a-parser.com/resources/286/]

В А-Парсере есть стандартный парсер Check::RosKomNadzor, который позволяет проверять наличие сайтов в базе РКН. Данные получаются напрямую из официального сервиса, для работы обязательно нужно подключать антигейт. Кроме того, официальный сервис РКН часто подвергается атакам, в связи с чем может быть недоступен. Но существуют альтернативные источники данных, доступность которых значительно выше и к тому же не требующие проверки в виде каптчи. Парсинг одного из таких источников и реализован в пресете по ссылке выше.


Простой парсер обменника с записью в БД SQLite [url=https://a-parser.com/resources/275/]

Как известно, в A-Parser есть возможность чтения/записи данных в БД SQLite. В этом рецепте показано использование этого функционала на примере парсинга курсов валют. Готовый парсер доступен по ссылке выше.


Еще больше различных рецептов в нашем Каталоге [url=https://a-parser.com/resources/]!

Предлагайте ваши идеи для новых парсеров здесь [url=https://a-parser.com/threads/3464/], лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube [url=https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw] - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter [url=https://twitter.com/a_parser].

Предыдущие сборники рецептов:
  • Сборник рецептов #1: Определяем CMS, оцениваем частотность ключевых слов и парсим Вконтакте [url=http://a-parser.com/threads/1250/]
  • Сборник рецептов #2: собираем форумы для XRumer, парсим email со страниц контактов [url=http://a-parser.com/threads/1328/]
  • Сборник рецептов #3: мобильные сайты, несколько парсеров, позиции ключевых слов [url=http://a-parser.com/threads/1660/]
  • Сборник рецептов #4: поиск в выдаче, парсинг интернет-магазина и скачиваем файлы [url=http://a-parser.com/threads/1674/]
  • Сборник рецептов #5: ссылки из JS, паблик прокси и карта сайта [url=http://a-parser.com/threads/1705/]
  • Сборник рецептов #6: парсим базу номеров телефонов и сохраняем результаты красиво [url=http://a-parser.com/threads/1737/]
  • Сборник рецептов #7: парсим RSS, качаем картинки и фильтруем результат по заголовкам [url=http://a-parser.com/threads/1778/]
  • Сборник рецептов #8: парсим 2GIS, Google translate и подсказки Youtube [url=http://a-parser.com/threads/1809/]
  • Сборник рецептов #9: проверяем сезонность ключевых слов и их полезность [url=http://a-parser.com/threads/1830/]
  • Сборник рецептов #10: пишем кастомный парсер поисковика и парсим дерево категорий [url=http://a-parser.com/threads/1881/]
  • Сборник рецептов #11: парсим Авито, работаем с JavaScript, анализируем тексты и участвуем в акции! [url=http://a-parser.com/threads/1938/]
  • Сборник рецептов #12: парсим Instagram, собираем статистику и делаем свои парсеры подсказок [url=http://a-parser.com/threads/2240/]
  • Сборник рецептов #13: сохраняем результат в файл дампа SQL и знакомимся с $tools.query [url=http://a-parser.com/threads/2460/]
  • Сборник рецептов #14: используем XPath, анализируем сайты и создаем комбинированные пресеты [url=http://a-parser.com/threads/2613/]
  • Сборник рецептов #15: анализируем скорость и юзабилити сайтов, парсим Яндекс.Картинки и Baidu [url=http://a-parser.com/threads/2712/]
  • Сборник рецептов #16: парсинг OpenSiteExplorer с авторизацией, Яндекс.Каталога и Яндекс.Новостей [url=https://a-parser.com/threads/2808/]
  • Сборник рецептов #17: картинки из Flickr, язык ключевых слов, список лайков в ВК [url=https://a-parser.com/threads/3544/]
  • Сборник рецептов #18: скриншоты сайтов, lite выдача Яндекса и проверка сайтов [url=https://a-parser.com/threads/3862/]
  • Сборник рецептов #19: публикация сообщений в Wordpress, парсинг Chrome Webstore и AliExpress [url=https://a-parser.com/threads/3910/]
  • Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов [url=https://a-parser.com/threads/4074/]
  • Сборник рецептов #21: уведомления в Telegram из A-Parser, мультифильтр и парсинг IMDb [url=https://a-parser.com/threads/4318/]
  • Сборник рецептов #22: проверка индексации в нескольких ПС, многоуровневый парсинг и поиск сабдоменов [url=https://a-parser.com/threads/4405/]
  • Сборник рецептов #23: категории сайтов, парсинг в YML и преобразование дат [url=https://a-parser.com/threads/4517/]
 
1.2.246 - обновление базы Rank::CMS и новые функции

1.2.246 - обновление базы Rank::CMS и новые функции в парсерах Baidu и MajesticSEO


Улучшения
  • В Rank::CMS[url=https://a-parser.com/wiki/rank-cms/] обновлена база определяемых движков, теперь поддерживается одновременно старый и новый формат apps.json (при обновлении рекомендуется также обновить apps.json)
  • SE::Baidu[url=https://a-parser.com/wiki/se-baidu/] полностью переписан:
    • добавлен парсинг related keywords
    • убран $cachedate из $serp, т.к. его похоже больше нет в выдаче
    • добавлена опция Get full link, преобразующая обрезанные ссылки в полные
    • исправлены некоторые регулярные выражения и баг с двойным http в ссылках
  • Изменения в Rank::MajesticSEO[url=https://a-parser.com/wiki/rank-majesticseo/]:
    • Добавлен параметр Check type, позволяет выбрать тип проверки: Root Domain/Subdomin/URL
    • Убран параметр Extract domain
    • Исправлена работа в некоторых случаях
  • Улучшена отзывчивость в редакторе JavaScript парсеров
  • Улучшена работа HTML::EmailExtractor[url=https://a-parser.com/wiki/html-emailextractor/], устранены зависания, которые возникали на определенных страницах
  • Обновлен список регионов в парсерах Яндекс
  • Пустой результат в SE::Google::Trends[url=https://a-parser.com/wiki/se-google-trends/] больше не считается неудачным запросом
  • Улучшена работа с сессиями в SE::Yandex::WordStat[url=https://a-parser.com/wiki/se-yandex-wordstat/]
Исправления в связи с изменениями в выдаче
  • Исправлен парсинг рекламы в SE::Yandex[url=https://a-parser.com/wiki/se-yandex/]
  • Исправлена работа, а также улучшен алгоритм парсинга в SE:: DuckDuckGo[url=https://a-parser.com/wiki/se-duckduckgo/]
  • Исправлено указание региона в парсерах Яндекс
  • Исправлен парсинг $ads.$i.visiblelink в SE::Google::Modern[url=https://a-parser.com/wiki/se-google-modern/]
  • Исправлен парсинг $totalcount в SE::Yandex:: Direct[url=https://a-parser.com/wiki/se-yandex-direct/]
Исправления
  • Исправлена ошибка, из-за которой процент обработанных запросов мог быть больше 100
  • Исправлены ошибки, из-за которых парсинг мог зависать при снятии с паузы, а также сбивался перебор в макросах подстановок
  • Исправлено отображение кириллицы в $headers в Net::HTTP[url=https://a-parser.com/wiki/net-http/]
  • Исправлена ошибка в Конструкторе результатов, из-за которой в редких случаях парсер мог падать
  • Устранена проблема с кодировкой при работе с SQLite
  • Исправлена ошибка со сменой прокси в JavaScript парсерах
 
Сборник статей #4: добавление товаров в OpenCart и парсинг JSON(https://a-parser.com/threads/4647/)

В 4-м сборнике статей будет рассмотрено добавление товаров в OpenCart, а также описано создание универсального парсера JSON. В каждой статье приложены готовые JS парсеры, используя которые, можно на реальных примерах изучить описанные методы и поэксперементировать с ними. Поехали!

Работаем с OpenCart. Часть 1. Вступление.(https://a-parser.com/resources/291/)

Данная статья начинает цикл об одной из наиболее часто запрашиваемых возможностей - заливке товаров в интернет-магазин. A-Parser - это универсальный инструмент, который кроме прочего может решать и такие задачи. Для тестов выбран движок OpenCart, в 1-й статье будет рассмотрена авторизация, получение списка товаров и добавление товара. Подробности, а также пример парсера - по ссылке выше.

32t3m_180712101444.png


Парсинг JSON ответов и работа с их содержимым(https://a-parser.com/resources/289/)

JSON - это довольно популярный способ предоставления данных, который, например, часто используется при работе с API различных сервисов. В А-Парсере есть встроенные инструменты для работы с ним, но не всегда их применение может быть простым, иногда требуется дополнительно писать сложные шаблоны, используя шаблонизатор. Поэтому в статье по ссылке выше будет рассказано, как написать простой универсальный парсер JSON.

a52w5_180711161912.png


Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки :) ) - отписывайтесь здесь(https://a-parser.com/threads/3464/).

Подписывайтесь на наш канал на Youtube(http://www.youtube.com/c/AParser_channel) - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter(http://www.youtube.com/c/AParser_channel).

Предыдущие сборники статей
  • Сборник статей #1: A-Parser для маркетологов, SEO-специалистов и реальный опыт работы(https://a-parser.com/threads/4009/)
  • Сборник статей #2: цикл статей-уроков по созданию JS парсеров(https://a-parser.com/threads/4142/)
  • Сборник статей #3: пагинация, переменные и БД SQLite(https://a-parser.com/threads/4442/)
 
Видео урок: Создание JS парсеров. Работа с SQLite

Продолжение цикла уроков по созданию JavaScript парсеров. В этом видео показано, как работать с базой данных SQLite в JS парсере.



В этом уроке рассмотрены:
- Знакомство с языком запросов SQL
- Создание простейшей базы данных SQLite при работе с JS-парсером
- Получение и запись данных в базу SQLite при работе с JS-парсером

Ссылки:
- http://www.sql-tutorial.ru/ru/content.html - учебник по SQL
- http://samoychiteli.ru/document29118.html - тоже учебник по SQL
- https://finance.i.ua/converter/ - сайт, который использовался в качестве примера
- https://a-parser.com/resources/276/ - статья и готовый парсер

Оставляйте комментарии и [https://www.youtube.com/c/AParser_channel] подписывайтесь на наш канал на YouTube!
 
1.2.270 - новый парсер Rank::Curlie, множество доработок в Node.js функционале



Улучшения
  • Добавлен новый парсер [url=https://a-parser.com/wiki/rank-curlie/]Rank::Curlie
  • В [url=https://a-parser.com/wiki/html-linkextractor/]HTML::LinkExtractor улучшена обработка портов по умолчанию, теперь ссылки с портом приводятся к каноническому виду
  • Оптимизирована работа [url=https://a-parser.com/wiki/se-yandex-wordstat/]SE::Yandex::WordStat
  • Улучшена работа с сессиями в [url=https://a-parser.com/wiki/se-yandex/]SE::Yandex
  • Улучшена обработка некорректных ответов в [url=https://a-parser.com/wiki/se-yandex/]SE::Yandex [url=https://a-parser.com/wiki/se-google-suggest/]SE::Google::Suggest
Исправления в связи с изменениями в выдаче
  • Исправлены [url=https://a-parser.com/wiki/se-bing/]SE::Bing, [url=https://a-parser.com/wiki/se-duckduckgo/]SE::DuckDuckGo и [url=https://a-parser.com/wiki/rank-majesticseo/]Rank::MajesticSEO
Исправления
  • Исправлена проблема с запуском на некоторых linux дистрибутивах
  • Исправлена загрузка node.js модулей в редких случаях на Windows
  • JS парсеры: добавлена поддержка dns.lookup и улучшена совместимость с модулем mysql2
  • JS парсеры: исправлен util.promisify
  • Исправлена работа некоторых Node.js модулей
  • В [url=https://a-parser.com/wiki/se-google-modern/]SE::Google::Modern и [url=https://a-parser.com/wiki/se-bing/]SE::Bing $totalcount при 0 результатов теперь возвращает 0
  • Исправлено логгирование в режиме foreground
 
25-й сборник рецептов

25-й сборник рецептов
25-й сборник рецептов. В нем будет показан способ периодического парсинга с дозаписью результатов в таблицу, рассмотрен парсинг с помощью Node.js модуля Cheerio без использования регулярных выражений, а также показан парсер первой мобильной поисковой системы в Китае - Shenma. Поехали!

[url=https://a-parser.com/resources/294/]Периодическая проверка обратных ссылок с дозаписью результатов в таблицу
Пример решения одной из наиболее запрашиваемых задач - дозапись периодически получаемых результатов в одну и ту же таблицу. В качестве хранилища данных используется SQLite, при каждом запуске данные добавляются и выводятся в таблицу. Готовый пресет с комментариями - по ссылке выше.


[url=https://a-parser.com/resources/296/]Парсер поисковой системы Haosou
Как известно, в основе почти любого парсера используются регулярные выражения, реже - XPath. Работа с этими методами требует определенных знаний, что в свою очередь может вызывать некоторые сложности. Поэтому существуют и другие методы. Использование одного из них на примере парсинга популярного в Китае поисковика Haosou, показано по ссылке выше.


[url=https://a-parser.com/resources/295/]Парсер китайского поисковика Shenma
Еще один китайский поисковик в этом сборнике - Shenma. Это первая мобильная поисковая система в Китае, ориентирована в первую очередь на мобильные сайты. Пресет - по ссылке выше.


Еще больше различных рецептов в нашем [url=https://a-parser.com/resources/]Каталоге!
Предлагайте ваши идеи для новых парсеров [url=https://a-parser.com/threads/3464/]здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на [url=https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw]наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в [url=https://twitter.com/a_parser]Twitter

Предыдущие сборники рецептов:
  • [url=http://a-parser.com/threads/1250/]Сборник рецептов #1: Определяем CMS, оцениваем частотность ключевых слов и парсим Вконтакте
  • [url=http://a-parser.com/threads/1328/]Сборник рецептов #2: собираем форумы для XRumer, парсим email со страниц контактов
  • [url=http://a-parser.com/threads/1660/]Сборник рецептов #3: мобильные сайты, несколько парсеров, позиции ключевых слов
  • [url=http://a-parser.com/threads/1674/]Сборник рецептов #4: поиск в выдаче, парсинг интернет-магазина и скачиваем файлы
  • [url=http://a-parser.com/threads/1705/]Сборник рецептов #5: ссылки из JS, паблик прокси и карта сайта
  • [url=http://a-parser.com/threads/1737/]Сборник рецептов #6: парсим базу номеров телефонов и сохраняем результаты красиво
  • [url=http://a-parser.com/threads/1778/]Сборник рецептов #7: парсим RSS, качаем картинки и фильтруем результат по заголовкам
  • [url=http://a-parser.com/threads/1809/]Сборник рецептов #8: парсим 2GIS, Google translate и подсказки Youtube
  • [url=http://a-parser.com/threads/1830/]Сборник рецептов #9: проверяем сезонность ключевых слов и их полезность
  • [url=http://a-parser.com/threads/1881/]Сборник рецептов #10: пишем кастомный парсер поисковика и парсим дерево категорий
  • [url=http://a-parser.com/threads/1938/]Сборник рецептов #11: парсим Авито, работаем с JavaScript, анализируем тексты и участвуем в акции!
  • [url=http://a-parser.com/threads/2240/]Сборник рецептов #12: парсим Instagram, собираем статистику и делаем свои парсеры подсказок
  • [url=http://a-parser.com/threads/2460/]Сборник рецептов #13: сохраняем результат в файл дампа SQL и знакомимся с $tools.query
  • [url=http://a-parser.com/threads/2613/]Сборник рецептов #14: используем XPath, анализируем сайты и создаем комбинированные пресеты
  • [url=http://a-parser.com/threads/2712/]Сборник рецептов #15: анализируем скорость и юзабилити сайтов, парсим Яндекс.Картинки и Baidu
  • [url=https://a-parser.com/threads/2808/]Сборник рецептов #16: парсинг OpenSiteExplorer с авторизацией, Яндекс.Каталога и Яндекс.Новостей
  • [url=https://a-parser.com/threads/3544/]Сборник рецептов #17: картинки из Flickr, язык ключевых слов, список лайков в ВК
  • [url=https://a-parser.com/threads/3862/]Сборник рецептов #18: скриншоты сайтов, lite выдача Яндекса и проверка сайтов
  • [url=https://a-parser.com/threads/3910/]Сборник рецептов #19: публикация сообщений в Wordpress, парсинг Chrome Webstore и AliExpress
  • [url=https://a-parser.com/threads/4074/]Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов
  • [url=https://a-parser.com/threads/4318/]Сборник рецептов #21: уведомления в Telegram из A-Parser, мультифильтр и парсинг IMDb
  • [url=https://a-parser.com/threads/4405/]Сборник рецептов #22: проверка индексации в нескольких ПС, многоуровневый парсинг и поиск сабдоменов
  • [url=https://a-parser.com/threads/4517/]Сборник рецептов #23: категории сайтов, парсинг в YML и преобразование дат
  • [url=https://a-parser.com/threads/4591/]Сборник рецептов #24: уведомление в Telegram об экспайре доменов, чекер РКН и работа с SQLite
 
Видео урок: Создание JS парсеров. Реализация подстановки запросов и их многопоточной обработки.(https://a-parser.com/threads/4738/)
Продолжение цикла уроков по созданию JavaScript парсеров. В этом видео будет показано, как "на лету" добавлять запросы в задание и многопоточно их обрабатывать.

В одной из наших статей(https://a-parser.com/resources/261/) мы рассмотрели способ разработки парсера, который собирает ТОП 10 из выдачи поисковика, а затем по очереди парсит нужные данные по полученным ссылкам. Вроде все неплохо, но если у вас не 10 запросов, несколько тысяч? Задание будет выполняться очень долго, а время это самый драгоценный и не восполняемый ресурс.
К счастью в A-Parser есть такая замечательная вещь, как многоуровневый парсинг, который позволяет многократно увеличить скорость парсинга, и в этом видео мы рассмотрим как этой возможностью пользоваться.

В этом уроке рассмотрено:
  • Реализация раздельных процедур парсинга в зависимости от внешних условий, а именно - уровня парсинга
  • Подстановка запросов в задание "на лету"
  • Использование стандартных парсеров в кастомных JavaScript парсерах
Ссылки:
  • Документация по JS парсерам(https://a-parser.com/wiki/js-parsers/)
  • Описание метода для подстановки запросов(https://a-parser.com/wiki/template-tools/#tools-query-%D0%B4%D0%BE%D0%B1%D0%B0%D0%B2%D0%BB%D0%B5%D0%BD%D0%B8%D0%B5-%D0%B7%D0%B0%D0%BF%D1%80%D0%BE%D1%81%D0%BE%D0%B2)
  • Статья и готовый парсер(https://a-parser.com/resources/264/)
Оставляйте комментарии и подписывайтесь на наш канал на YouTube(https://www.youtube.com/c/AParser_channel)!
 
1.2.292 - новый парсер Яндекс ИКС, улучшения в работе с кодировками, оптимизации встроенных парсеров(https://a-parser.com/threads/4762/)
1.2.292.png

Улучшения
  • Добавлен парсер
    se-yandex-sqi.png
    SE::Yandex::SQI(https://a-parser.com/wiki/se-yandex-sqi/") - парсер Индекса качества сайта (Яндекс ИКС)
  • Оптимизирована работа Очереди заданий
  • Добавлена поддержка множества экзотических кодировок китайского языка
  • Добавлена опция Save as UTF-8 with BOM, которая решает проблему определения кодировки при открытии сформированного CSV в Excel
  • se-youtube.png
    SE::Youtube(https://a-parser.com/wiki/se-youtube/) полностью переписан с использованием современного юзерагента
  • se-aol-suggest.png
    SE::AOL::Suggest(https://a-parser.com/wiki/se-aol-suggest/) оптимизирован и переписан на JavaScript
  • Улучшена работа
    se-google.png
    SE::Google(https://a-parser.com/wiki/se-google/),
    se-google.png
    SE::Google::Modern(https://a-parser.com/wiki/se-google-modern/),
    rank-majesticseo.png
    Rank::MajesticSEO(https://a-parser.com/wiki/rank-majesticseo/),
    se-bing.png
    SE::Bing(https://a-parser.com/wiki/se-bing/),
    shop-amazon.png
    Shop::Amazon(https://a-parser.com/wiki/shop-amazon/)
Исправления в связи с изменениями в выдаче
  • Исправлен парсинг мобильной выдачи в
    se-google.png
    SE::Google::Modern(https://a-parser.com/wiki/se-google-modern/)
  • Исправлено определение опечаток в
    se-google.png
    SE::Google(https://a-parser.com/wiki/se-google/) и
    se-google.png
    SE::Google::Modern(https://a-parser.com/wiki/se-google-modern/)
  • Исправлена ситуация, при которой в
    se-google.png
    SE::Google::Modern(https://a-parser.com/wiki/se-google-modern/) в сниппеты могли попадать ненужные ссылки
  • Исправлен парсинг рекламы в
    se-yandex.png
    SE::Yandex(https://a-parser.com/wiki/se-yandex/)
  • Исправлен парсинг количества результатов в
    se-youtube.png
    SE::Youtube(https://a-parser.com/wiki/se-youtube/")
  • Удален SE::Yandex::TIC, т.к. больше не актуален
  • Исправлен Shop::Yandex::Market(https://a-parser.com/wiki/shop-yandex-market/),SE:: DuckDuckGo(https://a-parser.com/wiki/se-duckduckgo/),SE::AOL::Suggest(https://a-parser.com/wiki/se-aol-suggest/)
Исправления
  • Исправлена работа Net::Whois(https://a-parser.com/wiki/net-whois/) для некоторых доменных зон
  • Исправлена ошибка, при которой не импортировался пресет, если не установлены модули, используемые в нем
  • Исправлена кодировка при использовании fs.readdirSync в JS парсерах
 
Сборник статей #5: собственный канал в Telegram и массовое добавление товаров в OpenCart(https://a-parser.com/threads/4783/)
В 5-м сборнике статей на реальном примере будет показано, как создать свой канал в Телеграме и полностью автоматизировать его наполнение контентом. Также мы продолжаем цикл статей по работе с OpenCart и во 2-й части будет рассмотрен вопрос массового добавления товаров. Как обычно, в каждой статье приложены готовые JS парсеры, используя которые, можно на реальных примерах изучить описанные методы и поэксперементировать с ними. Поехали!

Полноценный Telegram канал на базе A-Parser(https://a-parser.com/resources/300/)
В этой статье будет описан способ создания полноценного канала в Telegram c автоматизированным сбором контента и постингом сообщений через заданные интервалы. И конечно, все это на базе A-Parser. Все подробности, а также готовые пресеты - по ссылке выше.
2018-09-13_11.28.45.png


Работаем с OpenCart. Часть 2. Массовое добавление товаров(https://a-parser.com/resources/302/)
Мы продолжаем цикл статей о заливке товаров в интернет-магазин на базе OpenCart. Во второй части будет рассмотрено массовое добавление товара. Подробности, а также пример готового парсера - по ссылке выше.
0iwja_180913140622.png


Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки :) ) - отписывайтесь здесь(https://a-parser.com/threads/3464/).

Подписывайтесь на там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники статей
  • Сборник статей #1: A-Parser для маркетологов, SEO-специалистов и реальный опыт работы
  • Сборник статей #2: цикл статей-уроков по созданию JS парсеров
  • Сборник статей #3: пагинация, переменные и БД SQLite
  • Сборник статей #4: добавление товаров в OpenCart и парсинг JSON
 
1.2.319 - новый парсер подсказок Youtube, поддержка модуля MySQL2, множество улучшений и оптимизаций(https://a-parser.com/threads/4832/)
1.2.319.png

Улучшения
  • Добавлен новый парсер
    se-youtube-suggest.png
    SE::Youtube::Suggest
  • Добавлена совместимость с модулем mysql2 в JavaScript парсерах
  • В
    util-recaptcha2.png
    Util::ReCaptcha2 добавлена поддержка сервиса R.I.P.captcha
  • В
    se-bing-suggest.png
    SE::Bing::Suggest добавлена возможность выбора страны
  • Уменьшено потребление оперативной памяти, а также оптимизирована начальная загрузка, интерфейс теперь открывается быстрее
  • База регионов в SE::Yandex обновлена и значительно увеличена
  • Для всех стандартных парсеров, кроме тех, которые работают на основе
    net-http.png
    Net::HTTP, из настроек убраны Max body size и Use gzip
  • Улучшен
    shop-amazon.png
    Shop::Amazon
Исправления в связи с изменениями в выдаче
  • Исправлен парсинг рекламы в
    se-google.png
    SE::Google::Modern
  • Исправлен парсинг в
    se-yandex.png
    SE::Yandex для регионов, отличных от российских
  • Полностью обновлен
    rank-semrush.png
    Rank::SEMrush
  • Исправлена проблема с загрузкой каптчи в
    se-yandex.png
    SE::Yandex,
    se-yandex-wordstat.png
    SE::Yandex::Wordstat
  • Исправлен парсинг количества результатов в
    se-yahoo.png
    SE::Yahoo
  • se-dogpile.png
    SE:: Dogpile,
    se-duckduckgo.png
    SE:: DuckDuckGo
Исправления
  • Исправлена работа с прокси при получении каптчи в SE::Yandex::Register
  • В очень редких случаях в SE::Yandex могла возникать ошибка Content mismatch
  • Исправлен Net::Whois при работе с .eu доменами
 
Последнее редактирование:
Видео урок: Полноценный Telegram канал на базе A-Parser
Это видео демонстрирует возможность создания полноценного Telegram канала на базе A-Parser. Парсер периодически и без вмешательства пользователя будет собирать контент и публиковать его на канале.

В уроке рассмотрены:
  • Регистрация и настройка канала в Телеграм.
  • Последовательное выполнение нескольких заданий.
  • Сохранение промежуточных данных в базу SQLite с последующим чтением.
  • Настройка пресета для постинга сообщений в Telegram-канал.
Статья с подробным описанием процесса создания: https://a-parser.com/resources/300/
Ссылки на готовые пресеты:
https://a-parser.com/resources/38/
https://a-parser.com/resources/298/
https://a-parser.com/resources/299/
Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Сборник рецептов #26: мобильные версии сайтов, список регионов Яндекса и упоминания домена в индексе(https://a-parser.com/threads/4899/)
26-й сборник рецептов. В нем будут показаны: проверка наличия мобильной версии сайта через Bing, парсинг полного списка регионов Яндекса и способ поиска упоминаний домена в индексе поисковой системы. Также показан пример работы с Node.js модулем mysql2, который позволяет работать с MySQL базами данных. Поехали!

[Проверка наличия мобильной версии через Bing](https://a-parser.com/resources/306/)
На сегодняшний день наличие мобильной версии является одним из важнейших критериев качества сайта. По данным различных организаций доля мобильного трафика уже давно превышает десктопный. Именно поэтому мобильная версия сайта позволяет увеличить посещаемость сайта, ведь большинство крупных поисковиков отдают предпочтение в выдаче сайтам, имеющим полноценную мобильную версию. Проверить наличие и соответствие стандартам можно с помощью небольшого пресета по ссылке выше.
4bqcm_181023235947.png


Получение полного списка регионов Яндекса(https://a-parser.com/resources/307/)
Яндекс не публикует в открытом виде полного списка всех регионов, используемых в поиске. И как оказалось, найти полную и актуальную базу в интернете практически невозможно. Поэтому мы исправляем это и по ссылке выше публикуем JavaScript парсер, который позволяет собрать свежую и максимально полную базу регионов Яндекса.
2of3y_181024152530.png


Проверка упоминаний домена в индексе Гугла(https://a-parser.com/resources/305/)
Иногда возникает задача по поиску упоминаний домена в индексе поисковой системы. Именно с такой задачей к нам обратился один из пользователей A-Parser. Поэтому по ссылке выше мы публикуем пресет, решающий данную задачу.
gwr92_181018190314.png


Кроме этого:
  • Пример работы с модулем mysql2(https://a-parser.com/resources/308/)
Еще больше различных рецептов в нашем Каталоге!
Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube(https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw) - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter(https://twitter.com/a_parser).
 
1.2.335 - новые парсеры картинок, оптимизации в JS парсерах, общие улучшения работы(https://a-parser.com/threads/4919/)
1.2.335.png

Улучшения
  • Добавлено 2 новых парсера:
    • se-duckduckgo-images.png
      SE:: DuckDuckGo::Images - парсер картинок из DuckDuckGo
    • se-dogpile-images.png
      SE:: Dogpile::Images- парсер картинок из Dogpile
  • Полностью переписаны 2 парсера:
    • se-google-images.png
      SE::Google::Images - добавлены региональные настройки, поддержка рекаптчи, возможность задавать различные фильтры поиска и сбор анкоров, ссылок на страницу, ссылок на превью, а также типов изображений
    • se-yandex-images.png
      SE::Yandex::Images - добавлен сбор ссылок на превью
  • Улучшена работа
    se-aol.png
    SE::AOL, а также увеличено максимальное количество страниц в настройках
  • Улучшена работа
    se-ask.png
    SE::Ask, а также добавлена возможность парсить связанные ключевые слова
  • JS парсеры: оптимизирован вызов конструктора и init()
  • JS парсеры: добавлена поддержка async init()
Исправления в связи с изменениями в выдаче
  • Исправлен парсинг анкоров в
    se-google.png
    SE::Google::Modern
  • Исправлено указание региона в
    se-yandex.png
    SE::Yandex
  • В
    shop-aliexpress.png
    Shop::AliExpress исправлен проход по страницам
  • se-bing-images.png
    SE::Bing::Images, SE::D ogpile
    se-duckduckgo.png
    [SE:: DuckDuckGo, SE::Google::ByImage]
Исправления
  • Исправлена утечка памяти при большом количестве попыток
  • Исправлена ошибка, при которой в Тестовом парсинге при работе с некоторыми ссылками не завершался запрос
  • Исправлен парсинг различных параметров вNet::Whois
  • Исправлено отображение русского языка (проблема появилась в предыдущей версии)
  • Исправлено зависание при работе SE::Yandex::Images с антигейтом
  • JS парсеры: исправлена работа check_content
  • JS парсеры: исправлена работа с сессиями (проблема появилась в одной из предыдущих версий)
 
Видео урок: Массовое добавление товаров в OpenCart, часть 2(https://a-parser.com/threads/4942/)

Это вторая часть из цикла видео уроков о парсинге товаров из стороннего сайта и заливке их на собственный сайт на базе OpenCart через API.

В этом уроке показано:
  • краткое содержание предыдущей части
  • запуск созданного пресета
  • демонстрация результатов работы
Первая часть: https://a-parser.com/threads/4798/
Статья и готовый пресет опубликованы в нашем Каталоге: https://a-parser.com/resources/302/
Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Сборник рецептов #27: парсинг HH, сбор списка user-agent и парсинг Авито с записью в MySQL(https://a-parser.com/threads/4971/)
27-й сборник рецептов. В нем собраны рецепты для парсинга списка соискателей на hh.ru, сбора списка юзерагентов и парсинга Авито с записью результатов в MySQL базу данных. Также показан пример отправки файлов в POST запросе. Поехали!

Сбор списка соискателей на HeadHunter
HeadHunter - это один из самых популярных ресурсов для поиска работы. Соответственно, сбор списка соискателей может быть интересен рекрутерам для более эффективного анализа потенциальных кандидатов. Готовое решение для парсинга доступно по ссылке выше.
gxd1b_181106115235.png


Получение списка user-agent
Сейчас существует много различных браузеров, которые работают на разных платформах. Многие сайты ограничивают работу со старыми браузерами, а некоторые не отдают контент даже при запросе с юзерагентом относительно нового браузера. В A-Parser можно задавать user-agent для запросов, также существует специальный инструмент, который позволяет при каждом запросе выбирать рандомный из заранее подготовленного списка. Пресет для парсинга таких списков, с возможностью фильтрации по различным параметрам, доступен по ссылке выше.
o60s7_181114181054.png


Парсер Avito с записью в MySQL
Предыдущий пресет для парсинга Авито пользуется большой популярностью. Также наши пользователи часто спрашивают о возможности записи собранных результатов напрямую в базу данных. Поэтому мы подготовили JS парсер, который решает эту задачу. Как обычно, он доступен по ссылке выше.
lvi3y_181127232540.png


Кроме этого:

  • [* Отправка файлов в POST запросе - пример решения задачи по отправке файлов в POST запросах.

Еще больше различных рецептов в нашем Каталоге(https://a-parser.com/resources/)!

Предлагайте ваши идеи для новых парсеров здесь(https://a-parser.com/threads/3464/), лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube(https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw) - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter(https://twitter.com/a_parser).
 
На вашем форуме не могу зарегистрироваться, потому, что требуете наличие лицензии.
 
Назад
Сверху