Общие сведения о поисковых системах
Общие сведения о поисковых системах
Поисковые системы – это специальные серверы, которые занимаются поиском, сбором и упорядочением информации, имеющейся на просторах Интернета. Основным их назначением является обеспечение пользователей необходимой информацией в результате быстрого и удобного поиска в Сети. Поисковые машины состоят из пяти основных компонентов.
1. «Паук» (spider) – программа, предназначенная для скачивания веб-страниц. Паук работает как обыкновенный браузер и занимается поиском информации в Сети. Путешествуя по ссылкам, эта программа загружает найденные страницы на сервер поисковой системы и тем самым пополняет ее базу данных.
2. «Червяк» (crawler) – как и паук, занимается скачиванием страниц. Кроме того, он исследует обнаруженные веб-страницы и извлекает все находящиеся на них ссылки. Полученные ссылки впоследствии будут использоваться пауком для дальнейшего путешествия по Сети.
3. Индексатор (indexer) – программа, служащая для упорядочивания информации, найденной пауками. Индексатор разбивает текст документа на составляющие его слова, при этом запоминая их местонахождение, анализируя, написано слово прописными или строчными буквами, является ли оно названием документа, текстом ссылки и т. д.
4. База данных (database) – представляет собой хранилище всех обработанных данных, накопленных поисковой системой.
5. Механизм выдачи результатов (search engine) – предназначен для взаимодействия пользователя с базой данных. С ним вы постоянно будете иметь дело при поиске какой-либо информации. Именно этот механизм определяет, какие вебстраницы вам представлять в соответствии с вашим запросом.
После задания вами ключевого слова или фразы поисковая система осуществляет поиск и выдает вам результат, который представляет собой список найденных веб-страниц, соответствующих вашему запросу. Для определения порядка, в котором будет показаны документы в списке, поисковая машина применяет алгоритм ранжирования. В идеале наиболее релевантные вашему запросу страницы будут расположены в списке первыми. Однако идеальный алгоритм ранжирования не найден, поэтому каждая поисковая система использует собственный, хотя отбор результатов во всех системах основывается примерно на следующих критериях:
– наличие ключевых слов в заголовке;
– плотность ключевых слов в содержимом документа, то есть количество искомых слов в тексте веб-страницы;
– расположение ключевых слов в документе;
– стиль ключевых слов (полужирный, курсив);
– индекс цитируемости – количество ссылок, ведущих на данную веб-страницу с других страниц;
– наличие ключевого слова в имени домена или адресе страницы.
После того как вы щелкнете на ссылке одного из документов в списке, предложенном вам поисковой системой, веб-страница будет запрошена с того сервера, на котором она находится.
Данный текст является ознакомительным фрагментом.