Представниците на Google предупредуваат дека злоупотребата на внатрешните пребарувачи од страна на спамери за автоматско генерирање нерелевантни страници може да доведе до третирање на веб-локацијата како хакирана и сериозно да го наруши нејзиното рангирање.
Речиси секоја веб-страница поседува поле за внатрешно пребарување, но менаџерите на веб-локациите често не земаат предвид дека користењето на оваа функција генерира единствена URL-адреса што го содржи внесениот поим. Оваа функционалност ја користат спамерите за масовно креирање страници што содржат спам-брендови, надворешни врски и илегални контакти, искористувајќи ги веб-локациите како вектори за дистрибуција на спам.
За овој проблем во 113-тата епизода од подкастот „Search Off The Record“ дискутираа Џон Муелер и Мартин Сплит од Google. Според Муелер, доколку авто-генерираните страници од внатрешното пребарување се достапни за индексирање од пребарувачите, тие стануваат директен ризик за квалитетот на целата веб-локација.
„Има едно место каде што би можеле да се соочите со проблеми со квалитетот со страниците со резултати од пребарувањето. имено, ако им дозволите на луѓето да пребаруваат работи што се потполно нерелевантни за вашата веб-локација, а вашата страница со резултати ги содржи тие термини и е индексна… Тоа не е толку поради тоа што некој ја хакирал вашата веб-локација, бидејќи таа тоа го прави слободно, туку бидејќи е достапно за секој термин, одеднаш станува обврска и вектор за спамирање“, истакна Џон Муелер.
Спамерите ги препознаваат популарните системи за управување со содржини (CMS) чии страници од внатрешното пребарување не се блокирани, по што автоматски креираат илјадници врски кон милиони страници кои содржат броеви за контакт, фармација, содржини за возрасни или сметки на Telegram. Кога овие страници почнуваат да се појавуваат во резултатите од пребарувањето на Google, алгоритмите можат да ги означат како хакирани, што се прикажува и како предупредување во алатката Google Search Console.
Покрај директното нарушување на репутацијата и квалитетот, Мартин Сплит предупреди и на техничкиот проблем со создавање „бесконечен простор за кролирање“ (infinite crawl space). Доколку пребарувачот на сајтот содржи дополнителни функции како „дали мислевте на…“, бота на Google влегува во затворен круг на генерирање нови и нови страници.
„Тие можат да бидат бесконечни простори за кролирање бидејќи можеме фундаментално да генерираме страница по страница, а можеби и поврзуваме со ‘дали мислевте на’, со што создаваме уште повеќе страници во кои бота потонува“, појасни Мартин Сплит.
Ваквото бесконечно кролирање доведува до драстично трошење на буџетот за кролирање (crawl budget) и непотребно преоптоварување на опслужувачите на веб-локацијата.
За спречување на овој проблем, претставниците на Google препорачуваат две стратегии: спречување на кролирањето и спречување на индексирањето. Притоа, тие посочуваат дека најдобро и најчисто решение е користење на датотеката robots.txt за целосно блокирање на роботите на пребарувачите да пристапуваат до страниците генерирани од внатрешното пребарување. Со тоа се спречува губењето на буџетот за кролирање, се намалува оптоварувањето на серверот и се елиминира ризикот сајтот да биде означен како хакиран.






























