[Десктопный софт] A-Parser 1.1 - продвинутый парсер поисковых систем, Suggest, PR, DMOZ, Whois, etc

Сборник рецептов #18: скриншоты сайтов, lite выдача Яндекса и проверка сайтов

18-й сборник рецептов. В нем мы будем смотреть как выглядят сайты сразу в нескольких браузерах, протестируем облегченную выдачу Яндекса и проверим сайты в Яндексы. Кроме этого в сборнике предоставлены парсер для проверки существования e-mail'ов и пресет для получения позиций сразу по нескольким регионам. Итак, поехали!

Автоматизация тестирования сайтов в разных браузерах
Наверное каждый разработчик сайтов сталкивается с вопросом тестирования своих наработок в различных браузерах. Можно конечно держать для этого несколько виртуальных машин, что далеко не совсем рационально. Можно собирать отзывы от пользователей, что негативно влияет на общее впечатление от сайта тех же пользователей. А можно воспользоваться специализированными сервисами. Например BrowserStack. А с помощью А-Парсера этот процесс можно еще и автоматизировать, если к примеру нужно сразу протестировать множество сайтов. Как это сделать - читайте по ссылке выше.

bscreen2.png


Парсинг lite выдачи Яндекса
Недавно на Хабре была опубликована статья о lite выдаче поиска Яндекса. Нам стало интересно, насколько такая выдача может быть полезной в сравнении с обычной с точки зрения парсинга. Мы с помощью функционала JS парсеров сделали новый парсер и сравнили его со стандартным. Как это было, что из этого вышло и какие получились выводы, а также готовый парсер lite выдачи Яндекса - по ссылке выше.

0d99H.png


Проверка сайта в Яндекс
Поисковую выдачу Яндекса можно использовать для решения самых разных задач. Одна из них - проверка сайтов на различные типы угроз. Яндекс отмечает такие сайты в выдаче специальными метками. С помощью A-Parser можно быстро проверить большие списки сайтов на наличие таких меток. Как это сделать - описано по ссылке выше.

Attache.png


Кроме этого:

Еще больше различных рецептов в нашем обновленном Каталоге!
Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Сборник рецептов #1: Определяем CMS, оцениваем частотность ключевых слов и парсим Вконтакте
Сборник рецептов #2: собираем форумы для XRumer, парсим email со страниц контактов
Сборник рецептов #3: мобильные сайты, несколько парсеров, позиции ключевых слов
Сборник рецептов #4: поиск в выдаче, парсинг интернет-магазина и скачиваем файлы
Сборник рецептов #5: ссылки из JS, паблик прокси и карта сайта
Сборник рецептов #6: парсим базу номеров телефонов и сохраняем результаты красиво
Сборник рецептов #7: парсим RSS, качаем картинки и фильтруем результат по заголовкам
Сборник рецептов #8: парсим 2GIS, Google translate и подсказки Youtube
Сборник рецептов #9: проверяем сезонность ключевых слов и их полезность
Сборник рецептов #10: пишем кастомный парсер поисковика и парсим дерево категорий
Сборник рецептов #11: парсим Авито, работаем с JavaScript, анализируем тексты и участвуем в акции!
Сборник рецептов #12: парсим Instagram, собираем статистику и делаем свои парсеры подсказок
Сборник рецептов #13: сохраняем результат в файл дампа SQL и знакомимся с $tools.query
Сборник рецептов #14: используем XPath, анализируем сайты и создаем комбинированные пресеты
Сборник рецептов #15: анализируем скорость и юзабилити сайтов, парсим Яндекс.Картинки и Baidu
Сборник рецептов #16: парсинг OpenSiteExplorer с авторизацией, Яндекс.Каталога и Яндекс.Новостей
Сборник рецептов #17: картинки из Flickr, язык ключевых слов, список лайков в ВК
 
Прием оплаты криптовалютами (Bitcoin и т.п.)

После отключения приема Интеркассой биткоинов, мы добавили собственную возможность оплаты в личном кабинете различными криптовалютами. Поддерживаются Bitcoin, BCH, LTC, ETH и другие альткоины.
crypto.png


Для того чтобы сделать оплату, достаточно выбрать в личном кабинете соответствующий способ:
FireShot_Capture_3_-_Lichnyi_kabinet_I_A-Parser_-_parser___-_https___a-parser.com_pages_members-area_.png


И проследовать дальнейшим инструкциям, выбрав нужную криптовалюту.

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
19-й сборник рецептов

Сборник рецептов #19: публикация сообщений в Wordpress, парсинг Chrome Webstore и AliExpress

19-й сборник рецептов. В нем мы будем постить сообщения в блоги Wordpress, парсить Chrome Webstore и AliExpress. Поехали!

Постинг сообщений в Wordpress блоги
Как известно, А-Парсер - это многофункциональный парсер. И он настолько многофункционален, что может не только парсить, но и постить! О том, как это сделать, пойдет речь в этой статье. В качестве примера выбран один из самых популярных движков - Wordpress. Все подробности, а также готовый постер - по ссылке выше.

WPPost2.png


Получение ссылок на плагины из Chrome Webstore
Браузер Chrome является одним из самых популярных в мире. И в нем практически с самого начала существования есть поддержка расширений, которые доступны в специальном магазине. Данный магазин представляет собой обычный сайт, который, как и любые другие, можно парсить. Полученная информация может быть использована к примеру для создания собственного магазина расширений или парсинга текстовок. Детальнее о том, как создавать такие парсеры - в статье по ссылке выше.

3kwix_171019120822.png


Парсер AliExpress
AliExpress - это одна из крупнейших торговых онлайн площадок. Парсинг данных о товарах из алиэкспресс позволяет проводить сравнение цен, получать картинки и названия товаров. Готовый парсер JS::Shop::AliExpress доступен в нашем каталоге по ссылке выше.

ali2.png


Кроме этого:

Еще больше различных рецептов в нашем обновленном Каталоге!
Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники:
 
1.2.0 - обновленный интерфейс и множество улучшений

1.2.0 - обновленный интерфейс и множество улучшений

Мы рады представить релиз A-Parser 1.2.0 - результат почти двухмесячной разработки на бета-канале!
Полностью обновленный интерфейс, переработан ряд парсеров, реализовано множество различных улучшений.

yreu5_171109011859.png


Новые парсеры
  • se-google.png
    SE::Google::Modern - теперь старая, новая и мобильная выдачи в одном парсере, а также поддержка работы с каптчами и рекаптчами
  • util-recaptcha2.png
    Util::ReCaptcha2 - распознавание Google ReCaptcha2 через популярные сервисы (anti-captcha, rucaptcha, CapMonster, а в скором будущем и xevil)

Улучшения

  • Полностью обновлен интерфейс
  • Добавлен статусбар, в котором выводится
    • статус парсера
    • количество работающих и всего заданий
    • количество живых и загруженных прокси
    • количество задействованных потоков
  • Полностью изменен выбор файлов запросов. Теперь легко можно выбирать несколько файлов, а также папки целиком
  • Реализована возможность получать JSON для API прямо в Редакторе заданий
  • Добавлен поиск во всех списках
  • Добавлена возможность сворачивания меню для увеличения рабочей области
  • В Тестовом парсинге добавлена новая область быстрых настроек: отключение автоскрола и включение debug режима
  • Добавлено предупреждение о риске затереть конфиг при обновлении через интерфейс
  • Добавлена возможность включения форматирования больших чисел
  • JS парсеры: добавлена опция use_proxy для this.request, которая позволяет переопределить использование прокси для отдельного запроса внутри JS парсера поверх глобального параметра Use proxy
  • JS парсеры: this.util переименован в this.utils и добавлены новые функции
  • JS парсеры: добавлена группировка в списке парсеров
  • Изменена иконка приложения, а также иконки некоторых парсеров
Исправления
  • Исправлена ситуация, когда оставались форматы запросов с предыдущего открытого задания
  • Исправлен перевод запросов с кавычками в
    se-yandex-translate.png
    SE::Yandex::Translate
  • Исправлен баг с сохранением переменных уникализации в некоторых случаях
  • Исправлена ошибка в
    se-google.png
    SE::Google при работе со старой каптчей
  • Исправлена ошибка при открытии лога (возникла в одной из предыдущих версий)
  • Исправлена ошибка при удалении заданий (возникла в одной из предыдущих версий)
Исправления в связи с изменениями в выдачи

Впереди у нас еще очень много планов, поэтому оставайтесь с нами и следите за новостями!
 
Мы начинаем публикацию статей об использовании A-Parser для решения различных задач

Мы начинаем публикацию статей об использовании A-Parser для решения различных задач.
В этом сборнике будет рассмотрено использование А-Парсера SEO-специалистами и маркетологами, а также описан реальный пользовательский опыт работы. Поехали!

A-Parser для SEO специалиста
В статье рассмотрена актуальность использования A-Parsera в работе SEO мастера. Определено место парсера в системе SEO оптимизации. На конкретных примерах продемонстрирована его практическая ценность.
stat4mod.png


Интернет-маркетинг и A-Parser
В статье рассмотрены понятия интернет-маркетинга и место в нем A-Parser. Актуализирован вопрос целесообразности использования парсера для интернет-маркетинга. Показаны практические примеры использования парсера в области интернет-маркетинга.
mark.png


Как я пришел к покупке A-Parser в 2016 году!
Описание реального опыта использования парсера одним из наших пользователей. На примере одной из задач показан подход к ее решению и реальная финансовая выгода.
hjhdjfu74tjhbfh.png


Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки :) ) - отписывайтесь здесь.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.
 
[B]1.2.31 - x64 для Windows, обновление JS движка

1.2.31 - x64 для Windows, обновление JS движка, улучшения работы с сохраненными заданиями

Улучшения
  • Для Windows начат выпуск 64-битных сборок
  • Переработан интерфейс выбора сохраненных заданий, теперь пресеты можно сортировать по папкам любой вложенности
    oz41l_171204112551.png

  • Реализована "ленивая" загрузка сохраненных пресетов
  • В 64-битных windows/linux версиях обновлен JavaScript движок V8 до версии 6.3
  • se-bing-translator.png
    SE::Bing::Translator полностью переписан, исправлена проблема, когда не переводился текст с html тегами и двойными кавычками, а также теперь переводятся большие тексты
  • Добавлено автодополнение Provider url для CapMonster в
    util-recaptcha2.png
    Util::ReCaptcha2
  • Добавлена возможность парсинга Cloudflare protected e-mails в
    html-emailextractor.png
    HTML::EmailExtractor
  • Добавлена сортировка JS парсеров внутри папок
  • Уведомление о новой версии перенесено в статусбар
  • Улучшена плавность при просмотре логов в Тестовом парсинге
Исправления в связи с изменениями в выдачи
Исправления
  • Исправлен баг, при котором список пресетов антигейта не обновлялся после создания нового
  • Исправлены падения парсера при использовании удаленного пресета антигейта
  • Исправлена работа через API при вызове сохраненного задания
  • Исправлена ошибка с $followlinks в
    html-linkextractor.png
    HTML::LinkExtractor
  • Исправлено определение кодировки на некоторых сайтах
  • Исправлен подсчет неудачных запросов в некоторых случаях
  • Исправлена ошибка с Custom template в фильтрах
  • Исправлена работа кнопки Обновить в логах
  • Исправлена ошибка Can't call method "Parser::HTML::Util::urlFromHTML", возникшая в одной из предыдущих версий
  • Исправлены зависания при использовании уникализации в некоторых случаях
  • Исправлена проверка обновлений после смены канала
 
Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов

Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов

В 20-м сборнике рецептов наш пользователь glukmaster поделится опытом решения реальной задачи на практике с помощью A-Parser. А также мы будем анализировать тексты и автоматизировать регистрацию аккаунтов Яндекса. Поехали!

Автоматическое обновление цен 5000 товаров в интернет-магазине на Bitrix
Цикл видео из 7 частей, в которых очень детально и наглядно показано, как решать такую задачу, как обновление цен в интернет магазине. Для парсинга используется A-Parser. Посмотреть видео можно по ссылке выше.
mypic.png


Анализ текста
Одним из самых популярных кейсов по применению А-Парсера является парсинг текстов. При этом возникает задача их анализа. Полноценно решить эту задачу позволяют специальные ресурсы. Ранее мы уже публиковали пресет по парсингу одного из таких сервисов. Теперь же это решение полностью переписано в виде JS-парсера, добавлена возможность анализировать не только тексты, а и полностью страницы, т.е. подавать на вход ссылки. Все детали и сам парсер - по ссылке выше.
istio.png


Автоматизация регистрации аккаунтов Яндекса
Как известно, для парсинга WordStat нужны аккаунты Яндекса. А-Парсер умеет их регистрировать, но их срок жизни невелик, т.к. спустя 1-2 суток включается проверка номера телефона. Поэтому возникает необходимость периодической регистрации новых аккаунтов. И это можно легко автоматизировать. По ссылке выше показано как это сделать.
2okcs_171107102640.png


Кроме этого:
Еще больше различных рецептов в нашем обновленном Каталоге!
Предлагайте ваши идеи для новых парсеров здесь, лучшие будут реализованы и опубликованы.
Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники рецептов:
Сборники статей:
 
1.2.50 - улучшение стабильности, поддержка Xevil и множество исправлений в стандартны

1.2.50 - улучшение стабильности, поддержка Xevil и множество исправлений в стандартных парсерах
new_version800px2.png

Улучшения

  • Уменьшение потребления памяти и улучшение стабильности работы x64 версий
  • Добавлена поддержка 2captcha и Xevil в
    util-recaptcha2.png
    Util::ReCaptcha2
  • Добавлен Parse all results и Parse related to level для
    se-bing.png
    SE::Bing
  • В
    se-bing.png
    SE::Bing добавлена возможность задавать Safe Search, а также добавлен повтор запроса при получении кешированной "короткой" выдачи
  • В
    se-yandex-translate.png
    SE::Yandex::Translate, добавлен обход ограничения на кол-во символов в запросе, что позволяет переводить очень большие запросы (>10k символов)
  • В
    se-google.png
    SE::Google::Modern добавлена возможность задать автоматическое определение языка интерфейса в зависимости от IP
  • Движок V8 обновлен до версии 6.4

Исправления в связи с изменениями в выдаче

Исправления
  • Исправлена работа
    se-bing.png
    SE::Bing:
    • устранена ситуация, когда выдавалась одинаковая выдача для всех страниц
    • исправлена работа параметра Links per page
    • исправлен парсинг количества результатов в некоторых ситуациях
    • исправлена ошибка, при которой не было результатов, если в выдаче одна ссылка
  • Исправлена работа с каптчей в
    se-yandex-wordstat.png
    SE::Yandex::Wordstat
  • Исправлена ошибка, когда при запросе с опечаткой
    se-google.png
    SE::Google::Modern не забирал результаты с первой страницы
  • Исправлена ошибка в
    rank-majesticseo.png
    Rank::MajesticSeo, при которой неправильно определялся бан IP
  • В
    se-google-trends.png
    SE::Google::Trends исправлена работа при изменении формата результата по-умолчанию
  • В
    se-google.png
    SE::Google::Modern для Search from country изменен параметр: вместо cr теперь используется gl - это на данный момент позволяет более точно задавать регион
  • Исправлена проблема с чрезмерным потреблением памяти в JavaScript парсерах
  • Исправлена ошибка влияющая на стабильность работы на Linux и Windows
  • Исправлена ошибка в SE::Yandex, при которой не было результатов, если в выдаче одна ссылка

Команда A-Parser поздравляет всех с Новым годом и Рождеством! Спасибо что вы с нами!
 
Сборник статей #2: цикл статей-уроков по созданию JS парсеров

Сборник статей #2: цикл статей-уроков по созданию JS парсеров

Как известно, в A-Parser есть возможность создавать свои собственные парсеры, которые могут иметь практически любую логику и в то же время позволяют пользоваться всеми преимуществами А-Парсера. Для написания таких парсеров используется язык JavaScript. В нашей документации подробно описаны все функции и методы, которые можно использовать при написании парсеров. А в сегодняшнем сборнике мы на практических примерах покажем наиболее часто применяемые функции. Поехали!

drcxx_180109125728.png

  1. Получение результатов от стандартного парсера.
    В этой статье описано использование функции yield this.parser.request, которая позволяет работать с уже существующими парсерами, получать от них данные и дополнительно обрабатывать их.
  2. Парсинг сайта с проходом по страницах.
    Здесь показан общий подход к созданию парсера, который будет "ходить" по страницам на сайте и забирать с них некоторую информацию.
  3. Парсинг title и description для топ10 сайтов по запросу.
    В данном примере показано как написать собственный парсер, который объединит в себе две разных задачи: парсинг топ10 сайтов и парсинг данных из каждого полученного сайта. При этом также будет показана возможность реализации выбора между несколькими поисковиками, что делает такой парсер еще более универсальным.
  4. Реализация подстановки запросов и их многопоточной обработки.
    Этот пример продемонстрирует, как "на лету" добавлять запросы с помощью tools.query.add, а также, как обрабатывать их в многопоточном режиме.
  5. Работа с CAPTCHA.
    В этой статье на простом примере будет показан общий подход к работе с сайтами, на которых появляется каптча. Будет пошагово разобран алгоритм и продемонстрирован результат работы.
  6. Работа с ReCaptcha2.
    А в этом примере по аналогии с обычной каптчей демонстрируется алгоритм работы с рекаптчей, а также вкратце поясняется принцип ее действия.
Для каждой статьи в конце будет продемонстрирован результат работы и дана ссылка на готовый парсер.

Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки :) ) - отписывайтесь здесь.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter.

Предыдущие сборники статей
 
1.2.78 - поддержка сессий в JS парсерах, улучшение SE::Google::Modern, правки

1.2.78 - поддержка сессий в JS парсерах, улучшение SE::Google::Modern, правки в интерфейсе

1.2.78.800px.png


Улучшения

  • Добавлена поддержка сессий в JavaScript парсерах
  • В
    se-google.png
    SE::Google::Modern добавлена поддержка сессий и улучшена производительность за счет уменьшения частоты появления каптч/рекаптч
  • Добавлена переменная $query.prev - показывает запрос, который использовался на предыдущем уровне
  • Для JS парсеров добавлен метод this.logger.putHTML, который позволяет вывести в лог HTML код
  • В Lite версию добавлен
    se-google.png
    SE::Google::Modern и
    util-recaptcha2.png
    Util::ReCaptcha2
  • В x86 версиях добавлено предложение перейти на x64
  • Добавлена возможность переименовывания пресетов
  • В окне выбора пресета для папок реализована "память на сворачивание"
  • Изменены иконки для JS парсеров
  • Исправлены ошибки с переводом в интерфейсе
  • Исправлено отображение HTML тегов в логах
  • Исправлен баг при импорте с вложенным парсером
  • Исправлен баг с прокруткой при сохранении JS парсеров и пресетов
  • Доработан Конструктор регулярных выражений
  • Другие мелкие правки в интерфейсе, направленные на улучшение общей работы

Исправления в связи с изменениями в выдаче

  • В
    se-google.png
    SE::Google::Modern исправлен парсинг сниппетов и рекламы, а также мобильной выдачи
  • В
    se-google-suggest.png
    SE::Google::Suggest исправлен парсинг подсказок, а также добавлена опция Remove HTML tags, позволяющая получать подсказки с или без html тегов
  • Исправлен парсинг анкоров и сниппетов в
    se-duckduckgo.png
    SE :: DuckDuckGo
  • se-ask.png
    SE::Ask,
    se-dogpile.png
    SE :: Dogpile,
    rank-mustat.png
    Rank::Mustat

Исправления

  • Исправлен баг с перемещением заданий в очереди
  • В
    se-google.png
    SE::Google::Modern исправлен баг с кодировкой
  • Исправлена работа параметров Request delay и Extra query string во всех JS парсерах
  • Исправлен выбор файлов запросов
  • Исправлено отображение иконок для JS парсеров
 
Видео урок: Создание JS парсеров. Получение результатов от стандартного парсера

Это видео начинает цикл уроков по созданию JavaScript парсеров. Здесь рассказано о том, как начать писать собственные парсеры, используя функционал JS парсеров в А-Парсере.



В уроке рассмотрено:
  • Создание кастомного JS парсера
  • Использование встроенного парсера внутри JS парсера
  • Парсинг выдачи поисковой системы с фильтрацией результатов по заданному условию
Полезные ссылки:
Статья и готовый парсер: https://a-parser.com/resources/254/

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Видео урок: Создание JS парсеров. Парсинг сайта с проходом по страницах

Видео урок: Создание JS парсеров. Парсинг сайта с проходом по страницах

Второе видео в цикле уроков по созданию JavaScript парсеров. Здесь рассказано о том, как написать несложный парсер сайта, который будет "листать" страницы, используя функционал JS парсеров в А-Парсере.



В уроке рассмотрено:
  • Создание кастомного JavaScript парсера без использования встроенных парсеров
  • Парсинг контента сайта постранично с использованием регулярных выражений
  • Реализация прохода по страницам ("пагинации") в JS парсере
Статья и готовый парсер: https://a-parser.com/resources/255/

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
1.2.138 - поддержка Node.js модулей, обработка ReCaptcha2 во всех парсерах Google, парсер AliExpress

logo1_2_138_plus_npm.png


В A-Parser 1.2.138 добавлена эмуляция node версии 8.9.x с поддержкой загрузки модулей и частичной реализацией fs и net модулей. Это дает возможность обращаться из JavaScript парсеров напрямую к файловой системе, а также использовать подключение по TCP из модулей к другим сервисам(например mysql, redis, chrome...).

Все это позволило загружать и использовать node модули из каталога npm, в котором собраны множество полезных библиотек для обработки данных, коннекторы к базам данных и множество других интересных вещей. На данный момент протестированы следующие модули: md5, async-redis, jsdom, puppeter.

Улучшения
  • Добавлена поддержка Node.js модулей в JavaScript парсерах
  • se-google-position.png
    SE::Google::Position,
    se-google-compromised.png
    SE::Google::Compromised и
    se-google-trustcheck.png
    SE::Google::TrustCheck полностью переписаны, добавлена поддержка ReCaptcha2
  • Улучшена работы
    se-google.png
    SE::Google::Modern в целом
  • В
    se-youtube.png
    SE::Youtube добавлен выбор языка, а также реализована возможность включать/отключать Безопасный режим
  • Добавлен
    shop-aliexpress.png
    Shop::AliExpress
  • Улучшена проверка создаваемых переменных в пресетах
  • Улучшена работа сессий
  • Исправлено отображение имени файла запроса на карточке задания
  • Улучшена работа скрола в Тестовом парсинге
  • Добавлено удаление переносов из сниппетов в
    se-google.png
    SE::Google::Modern
  • Картинка каптчи в парсере
    se-yandex-register.png
    SE::Yandex::Register теперь скачивается через прокси
  • Множество мелких улучшений в интерфейсе
Исправления в связи с изменениями в выдаче
  • Исправлена работа SE::Youtube при переопределении опции Result type
  • Исправлен многостраничный парсинг в SE::Bing
  • Полностью переписан SE::Yandex::Register, добавлена возможность выводить ответ на секретный вопрос
  • Исправлена проверка следующей страницы в SE::Seznam
  • Устранена ситуация, когда в SE::Yandex::Position парсилась неполная ссылка
  • Исправлен подсчет неудачных запросов в SE::Google::TrustCheck и SE::Google::Compromised
  • SE::Yandex::Direct, Shop::Yandex::Market
Исправления
  • Исправлена работа Конструктора регулярных выражений
  • Исправлена работа с кодировками в парсерах переводчиков и JS парсерах
  • Исправлена работа SE::Google::Position
  • Исправлен выбор региона в SE::Yandex::Direct
  • Исправлена работа опции Location в SE::Google::Modern
  • Исправлена работа сессий в SE::Google::Modern] при переопределенном домене
  • Исправлена ошибка при совместном использовании опций Перезаписи файла, Начального и Конечного текстов
  • Исправлено отображение вкладок в Тесте задания
  • Исправлено отображение списка пресетов в поле Запустить по завершению
  • Исправлена работа this.proxy.set в JS парсерах
  • Исправлена передача дополнительных параметров в JS парсерах
  • Исправлена ошибка, из-за которой через API нельзя было указать Начальный и Конечный тексты
  • Исправлен экспорт пресетов
 
Использование Xevil совместно A-Parser для разгадывания ReCaptcha2

ap+xevil_logo.png


Как известно, сейчас Google при парсинге очень часто выдает рекаптчу, что значительно усложняет и замедляет сбор данных.
В A-Parser есть возможность обходить данную проблему, разгадывая рекаптчу с помощью сторонних сервисов. Поддерживаются различные онлайн сервисы, а также программные решения.

Одним из таких решений есть XEvil. Его использование дает хороший прирост в скорости, а также значительно удешевляет парсинг, ведь здесь нету оплаты за количество разгаданных каптч/рекаптч, как в онлайн сервисах. Кроме этого, XEvil умеет разгадывать практически любые обычные каптчи (в виде картинки) и данная возможность также поддерживается в A-Parser.



На данный момент использовать разгадывание рекаптчи с помощью XEvil можно в таких парсерах:

  • se-google.png
    SE::Google::Modern
  • se-google-position.png
    SE::Google::Position
  • se-google-trustcheck.png
    SE::Google::TrustCheck
  • se-google-compromised.png
    SE::Google::Compromised
  • rank-megaindex.png
    Rank::MegaIndex
  • а также любые кастомные JavaScript парсеры

В видео показано:
  • подключение Xevil к A-Parser для работы с ReCaptcha2
  • проверка работы и демонстрация работы в SE::Google::Modern

Ознакомиться более детально с возможностями XEvil можно по ссылкам:
  • http://www.botmasterlabs.net/
  • http://xevil.net/ru/

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Сборник рецептов #21: уведомления в Telegram из A-Parser, мультифильтр и парсинг IMDb

21-й сборник рецептов. В нем мы научимся отправлять сообщения в Telegram прямо из A-Parser, изучим работу с модулями Node.js в JS парсерах на примере решения задачи фильтрации по множеству признаков, а также спарсим весь IMDb. Поехали!

Уведомления в Telegram из A-Parser

Telegram является одним из самых популярных мессенджеров благодаря своей простоте, и в то же время большому функционалу. Среди прочего, в Телеграме можно создавать ботов, с помощью которых можно делать чаты более интерактивными. Взаимодействие с ботом на на стороне сервера происходит через Telegram Bot API. Используя эти возможности, можно легко и буквально за несколько минут настроить уведомления себе в Telegram прямо из парсера. О том, как это сделать, а также несколько реальных примеров - по ссылке выше.

oz78y_180315000445.png

ai5di_180314231615.png


Фильтрация по множеству признаков

Как известно, для фильтрации в А-Парсере используется встроенный функционал фильтров. Но бывают ситуации, когда список признаков, наличие которых нужно проверять, очень большой и его сложно вписать в строку стандартного фильтра.
Начиная с версии 1.2.127 в A-Parser добавлена поддержка модулей Node.js. Благодаря этому появилась возможность читать список признаков из файла и использовать его для проверки страниц. О том, как это сделать, а также готовый парсер с мультифильтром - по ссылке выше.

3cbbe_180315100634.png


Парсинг рекомендаций фильмов из IMDb

Пример решения задачи по сбору данных о фильмах и их рекомендаций на IMDb. Данная статья показывает, как можно решать задачи, которые на первый взгляд требуют много времени и ресурсов, буквально за несколько часов. Узнать о том, как спарсить весь IMDb за 1,5 часа, а также посмотреть пресет и забрать готовую базу можно по ссылке выше.

ecaoq_180220140515.png


Еще больше различных рецептов в нашем обновленном Каталоге!
Предлагайте ваши идеи для новых парсеров здесь(https://a-parser.com/threads/3464/), лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter

  • Сборник рецептов #1: Определяем CMS, оцениваем частотность ключевых слов и парсим Вконтакте
  • Сборник рецептов #2: собираем форумы для XRumer, парсим email со страниц контактов
  • Сборник рецептов #3: мобильные сайты, несколько парсеров, позиции ключевых слов
  • Сборник рецептов #4: поиск в выдаче, парсинг интернет-магазина и скачиваем файлы
  • Сборник рецептов #5: ссылки из JS, паблик прокси и карта сайта
  • Сборник рецептов #6: парсим базу номеров телефонов и сохраняем результаты красиво
  • Сборник рецептов #7: парсим RSS, качаем картинки и фильтруем результат по заголовкам
  • Сборник рецептов #8: парсим 2GIS, Google translate и подсказки Youtube
  • Сборник рецептов #9: проверяем сезонность ключевых слов и их полезность
  • Сборник рецептов #10: пишем кастомный парсер поисковика и парсим дерево категорий
  • Сборник рецептов #11: парсим Авито, работаем с JavaScript, анализируем тексты и участвуем в акции!
  • Сборник рецептов #12: парсим Instagram, собираем статистику и делаем свои парсеры подсказок
  • Сборник рецептов #13: сохраняем результат в файл дампа SQL и знакомимся с $tools.query
  • Сборник рецептов #14: используем XPath, анализируем сайты и создаем комбинированные пресеты
  • Сборник рецептов #15: анализируем скорость и юзабилити сайтов, парсим Яндекс.Картинки и Baidu
  • Сборник рецептов #16: парсинг OpenSiteExplorer с авторизацией, Яндекс.Каталога и Яндекс.Новостей
  • Сборник рецептов #17: картинки из Flickr, язык ключевых слов, список лайков в ВК
  • Сборник рецептов #18: скриншоты сайтов, lite выдача Яндекса и проверка сайтов
  • Сборник рецептов #19: публикация сообщений в Wordpress, парсинг Chrome Webstore и AliExpress
  • Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов

Сборники статей:
  • Сборник статей #1: A-Parser для маркетологов, SEO-специалистов и реальный опыт работы
  • Сборник статей #2: цикл статей-уроков по созданию JS парсеров
 
1.2.160 - поддержка SQLite, проверка доменов на клей, Parse all results в SE::Yahoo

ap+sqlite.png

Улучшения
  • Добавлена поддержка SQLite в JavaScript парсерах и шаблонизаторе, пример использования
  • Добавлена защита от случайного закрытия окна парсера
  • В
    se-yahoo.png
    SE::Yahoo добавлены Parse all results и Parse related to level
  • se-yandex-tic.png
    полностью переписан, добавлена возможность проверять домены на клей
  • В
    rank-megaindex.png
    Rank::MegaIndex добавлена поддержка ReCaptcha2
  • Улучшен парсинг сниппетов в
    se-duckduckgo.png
    SE:: DuckDuckGo
  • Улучшен сбор почт в
    html-emailextractor.png
    HTML::EmailExtractor
Исправления в связи с изменениями в выдаче
  • Обновлен алгоритм Bypass Cloudflare
  • se-bing-translator.png
    SE::Bing::Translator почти полностью переписан в связи с изменением логики работы переводчика Bing
  • Исправлена работа
    se-seznam.png
    SE::Seznam с некоторыми видами запросов
  • Исправлен парсинг related keywords, а также мобильной выдачи в
    se-google.png
    SE::Google::Modern
  • Исправлен парсинг related keywords в
    se-bing.png
    SE::Bing
  • Исправлена работа
    se-ixquick.png
    при работе с русскоязычными запросами
  • se-yandex-direct.png
    SE::Yandex:: Direct,
    se-google-byimage.png
    SE::Google::ByImage,
    se-yandex-wordstat.png
    SE::Yandex::WordStat
Исправления
  • Исправлена работа
    se-google.png
    SE::Google::Modern на IPv6 прокси
  • Исправлена ошибка, из-за которой
    se-google.png
    SE::Google::Modern собирал ссылки с пометкой опасных сайтов в общий массив ссылок
  • Исправлена работа с оператором поиска + в SE::Bing
  • Исправлен парсинг запросов со спецсимволами в SE:: DuckDuckGo
  • Исправлена работа Rank::MajesticSEO
  • Исправлен баг с overrideOpts в JS парсерах
  • Исправлена работа с переменными при их создании в Parse custom results, а также при использовании нижнего подчеркивания в именах в Конструкторе результатов
  • Исправлена работа tools.js, баг появился в одной из предыдущих версий
  • Исправлен баг, из-за которого А-Парсер падал на некоторых ОС, появился в одной из предыдущих версий
 
Видео урок: Создание JS парсеров. Работа с CAPTCHA

Третье видео в цикле уроков по созданию JavaScript парсеров. Здесь рассказано о том, как написать JS парсер, в котором будет поддержка антигейта для разгадывания каптч на страницах.



В уроке рассмотрено:
  • Создание JS-парсера для разгадывания капчи
  • Работа с объектом this.captcha внутри JavaScript кода
  • Описание процесса разгадывания каптчи, реализованного в A-Parser

Статья и готовый парсер: https://a-parser.com/resources/257/

Оставляйте комментарии и подписывайтесь на наш канал на YouTube!
 
Сборник рецептов #22: проверка индексации в нескольких ПС, многоуровневый парсинг

22-й сборник рецептов. В нем мы разберемся, как проверять индексацию всех страниц сайта одновременно в нескольких поисковиках, научимся парсить данные по ссылкам из выдачи одним заданием и будем искать сабдомены на сайтах. Поехали!

Получение страниц сайта и проверка индексации в Google и Яндексhttps://a-parser.com/resources/250/

Данный пресет позволяет спарсить ссылки на все страницы сайта и одновременно проверить их на предмет индексации поисковиками (в примере Google и Яндекс, можно по аналогии добавить другие ПС). Готовый пресет и описание по ссылке выше.


Парсим title и description для TOP10 поисковой выдачи по ключевому слову[url=https://a-parser.com/resources/263/]

Пример использования tools.query.add в JavaScript парсерах. Данный парсер получает ссылки из выдачи, после чего собирает из каждой страницы title и description. И все это одним заданием с максимальной производительностью, благодаря многопоточному парсингу. Парсер с описанием доступны по ссылке выше.


Поиск сабдоменов сайта[url=https://a-parser.com/resources/235/]

Небольшой пример, который демонстрирует, как собрать поддомены одного или нескольких сайтов. Используется HTML::LinkExtractor и Parse to level для прохода вглубь по страницам сайта. При этом Конструктором результатов извлекаются из внутренних ссылок домены и выводятся с уникализацией по строке. Готовый пресет - по ссылке выше.


Кроме этого:
  • Работа с SQLite из JavaScript парсеров[url=https://a-parser.com/resources/272/] - показаны все базовые возможности нового функционала по работе с SQLite
Еще больше различных рецептов в нашем Каталоге[url=https://a-parser.com/resources/]!
Предлагайте ваши идеи для новых парсеров здесь[url=https://a-parser.com/threads/3464/], лучшие будут реализованы и опубликованы.

Подписывайтесь на наш канал на Youtube[url=https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw] - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter[url=https://twitter.com/a_parser].

Предыдущие сборники рецептов:
  • Сборник рецептов #1: Определяем CMS, оцениваем частотность ключевых слов и парсим Вконтакте
  • Сборник рецептов #2: собираем форумы для XRumer, парсим email со страниц контактов
  • Сборник рецептов #3: мобильные сайты, несколько парсеров, позиции ключевых слов
  • Сборник рецептов #4: поиск в выдаче, парсинг интернет-магазина и скачиваем файлы
  • Сборник рецептов #5: ссылки из JS, паблик прокси и карта сайта
  • Сборник рецептов #6: парсим базу номеров телефонов и сохраняем результаты красиво
  • Сборник рецептов #7: парсим RSS, качаем картинки и фильтруем результат по заголовкам
  • Сборник рецептов #8: парсим 2GIS, Google translate и подсказки Youtube
  • Сборник рецептов #9: проверяем сезонность ключевых слов и их полезность
  • Сборник рецептов #10: пишем кастомный парсер поисковика и парсим дерево категорий
  • Сборник рецептов #11: парсим Авито, работаем с JavaScript, анализируем тексты и участвуем в акции!
  • Сборник рецептов #12: парсим Instagram, собираем статистику и делаем свои парсеры подсказок
  • Сборник рецептов #13: сохраняем результат в файл дампа SQL и знакомимся с $tools.query
  • Сборник рецептов #14: используем XPath, анализируем сайты и создаем комбинированные пресеты
  • Сборник рецептов #15: анализируем скорость и юзабилити сайтов, парсим Яндекс.Картинки и Baidu
  • Сборник рецептов #16: парсинг OpenSiteExplorer с авторизацией, Яндекс.Каталога и Яндекс.Новостей
  • Сборник рецептов #17: картинки из Flickr, язык ключевых слов, список лайков в ВК
  • Сборник рецептов #18: скриншоты сайтов, lite выдача Яндекса и проверка сайтов
  • Сборник рецептов #19: публикация сообщений в Wordpress, парсинг Chrome Webstore и AliExpress
  • Сборник рецептов #20: автообновление цен в ИМ, анализ текстов и регистрация аккаунтов
  • Сборник рецептов #21: уведомления в Telegram из A-Parser, мультифильтр и парсинг IMDb
 
Сборник статей #3: пагинация, переменные и БД SQLite(https://a-parser.com/threads/4442/)

В этом сборнике статей мы рассмотрим все возможные варианты решения задачи прохода по пагинации на сайтах, очень детально изучим работу с переменными в JavaScript парсерах, а также попробуем работать с базами данных SQLite на примере парсера курсов валют. Поехали!

Обзор вариантов прохода по пагинации(https://a-parser.com/resources/277/)
В A-Parser существует несколько способов, с помощью которых можно реализовать проход по пагинации. В связи с их разнообразием, становится актуальным вопрос выбора нужного алгоритма, который позволит максимально эффективно переходить по страницам в процессе парсинга. В этой статье мы постараемся разобраться с каждым из способов максимально подробно. Также будут показаны реальные примеры и даны рекомендации по оптимизации многостраничного парсинга. Статья - по ссылке выше.
ic2vg_180425160845.png


Переменные в парсерах JavaScript(https://a-parser.com/resources/278/)
JS парсеры в А-Парсере появились уже около года назад. Благодаря им стало возможным решать очень сложные задачи по парсингу, реализовывая практически любую логику. В этой статье мы максимально подробно изучим работу с разными типами переменных, а также узнаем, как можно оптимизировать работу сложных парсеров. Все это - в статье по ссылке выше.
xfhdsja54jdsbc734bw.png


Разработка JS парсера с сохранением результата в SQLite(https://a-parser.com/resources/276/)
Начиная с версии 1.2.152 в A-Parser появилась возможность работать с БД SQLite.
В данной статье мы рассмотрим разработку JavaScript парсера, который будет парсить курсы валют из сайта finance.i.ua и сохранять их в БД. В результате получится парсер, в котором продемонстрированы основные операции с базами данных. Подробности, а также готовый парсер - по ссылке выше.
n0hvs_180426111509.png


Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser (за небольшие плюшки :) ) - отписывайтесь здесь(https://a-parser.com/threads/3464/).

Подписывайтесь на наш канал на Youtube(https://www.youtube.com/channel/UCvypGICrfCky8tPtebmIvQw) - там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в Twitter(https://twitter.com/a_parser).

Предыдущие сборники статей
  • Сборник статей #1: A-Parser для маркетологов, SEO-специалистов и реальный опыт работы
  • Сборник статей #2: цикл статей-уроков по созданию JS парсеров
 
1.2.185 - увеличение скорости в SE::Google::Modern, новые возможности Net:: DNS, множество улучшений [url=https://a-parser.com/threads/4471/]

1.2.185.png


Улучшения


[*] SE::Google::Modern - многократно увеличена скорость парсинга

[*]Множество улучшений в Net:: DNS [url=https://a-parser.com/wiki/net-dns/]:
- Возможность указать несколько DNS и задать метод выбора
- Бан нерабочих/плохих DNS по специальному эвристическому алгоритму
- Возможность вывести в результат использованный DNS сервер при удачном запросе

[*]В SE::Google::Modern [url=https://a-parser.com/wiki/se-google-modern/] добавлена опция Use sessions

[*]В SE::Yandex::WordStat [url=https://a-parser.com/wiki/se-yandex-wordstat/] добавлена настройка пресета антигейта для логина

[*]Также в SE::Yandex::WordStat [url=https://a-parser.com/wiki/se-yandex-wordstat/] удалены настройки Use logins/Use sessions, теперь они включены всегда

[*]Добавлена возможность автоматического удаления задания из Завершенных

[*]В макросе подстановок {num} добавлена поддержка обратного отсчета

[*]В JavaScript парсерах добавлена возможность сохранения произвольных данных в сессии

[*]В JavaScript парсерах добавлена возможность прямого сохранения в файл

[*]В API методе oneRequest/bulkRequest добавлена возможность указать configPreset

[*]В связи с неактуальностью удалены парсеры SE::Google::Mobile и SE::Yandex::Catalog

Исправления в связи с изменениями в выдаче


[*]Исправлен парсинг сниппетов в SE::Yandex [url=https://a-parser.com/wiki/se-yandex/]

[*]В SE::Google::Modern [url=https://a-parser.com/wiki/se-google-modern/] исправлена пагинация в мобильной версии, а также парсинг сниппетов и рекламы в некоторых случаях

[*]Исправлен парсинг цен в GooglePlay::Apps [url=https://a-parser.com/wiki/googleplay-apps/]

[*]Исправлена работа функции Remove bad accounts в парсерах Wordstat

[*]Rank::MegaIndex [url=https://a-parser.com/wiki/rank-megaindex/], Rank:: openSiteExplorer [url=https://a-parser.com/wiki/rank-opensiteexplorer/], Rank:: openSiteExplorer::Extended [url=https://a-parser.com/wiki/rank-opensiteexplorer-extended/], SE:: DuckDuckGo [url=https://a-parser.com/wiki/se-duckduckgo/], SE::IxQuick [url=https://a-parser.com/wiki/se-ixquick/]

Исправления


[*]Количество неудачных больше не обнуляется при постановке на паузу

[*]Исправлена проблема с подключением Node.js модулей на Linux

[*]Исправлено падение парсера в редких ситуациях при использовании JS парсеров

[*]Решена проблема с подключением Node.js модулей lodash, sequelize

[*]Исправлена ошибка итератора при равных границах в макросе {num}
 
Назад
Сверху