SHI-Blog

Wissenswertes aus dem Software-Universum

How-Tos, Knowhow und Praxistipps: Unsere Blogreihe versorgt Sie mit bunt gemischtem IT-Wissen – informativ, topaktuell und mit echtem Mehrwert.

Document Routing in SolrCloud

Abstract In Solr 4.1 sind einige Neuerungen und Verbesserungen eingebaut worden.Dieser Beitrag stellt vor, wie man die Platzierung von einem Dokument in einem bestimmten Shard mit Hilfe eines Präfixes in der Dokument-ID steuern kann. Einführung Ab Version 4.1 ist in Solr die Möglichkeit hinzugekommen, indirekt Einfluss darauf zu nehmen, wie bzw. wohin Dokumente indexiert werden.Hierzu […]

Weiterlesen

Einführung in die Geo-Suche mit Solr

Neben der reinen Volltext-Suche wird die geografische Suche immer wichtiger. Viele von den Diensten heutzutage sind ortsgebunden, was auch Sinn macht, denn wenn ich Hunger habe und nach einer guten Pizzeria suche, nützt es mir nichts, wenn die Suche mir ein Lokal in Berlin vorschlägt und ich gerade in Augsburg unterwegs bin.Dieser Artikel befasst sich […]

Weiterlesen

SurroundQueryParser

In Solr 4.0 wurde nicht nur die SolrCloud eingeführt. Es gab auch abseits davon zahlreiche Neuerungen, darunter einige QueryParser. In diesem Beitrag wird nun der SurroundQueryParser vorgestellt, der es ermöglicht Wörter, die im Text nah beieinander stehen, zu matchen. Das bedeutet, er kann alternativ zum eDismax QueryParser mit den Parametern pf und ps benutzt werden. Diese beiden Möglichkeiten werden […]

Weiterlesen

Lots Of Cores / Neuer Artikel der Blogserie “Neuerungen rund um Solr”

Solr unterstützt MultiCore SetUps, d.h. eine Solr Instanz kann mehrere SolrCores gleichzeitig verwalten. Dies bietet viel Flexibilität bei der Nutzung von Solr bzw. der SolrCloud. Aktuell gibt es Bestrebungen hier noch ein paar Verbesserungen, vor allem im Cache Management, zu implementieren, denn momentan müssen erst alle Cores beim Start geladen werden bevor die Solr Instanz […]

Weiterlesen

Tipp – Suchen in der Cloud / Neuer Artikel der Blogserie “SolrCloud – Tipps, Tricks und Pitfalls”

Das Suchen in der SolrCloud unterscheidet sich prinzipiell nicht vom Suchen in einer herkömmlichen Solr Instanz. Die eigentlichen Requests sind nahezu identisch; der Core-Name, der Name des RequestHandler sowie Parameter sind weiterhin Bestandteil des Request. Es gibt im Umgang mit der SolrCloud ein paar spezielle Parameter, die die Suche in der Cloud stark beeinflussen können. […]

Weiterlesen

Tipp – clusterstate.json verstehen / Neuer Artikel der Blogserie “SolrCloud – Tipps, Tricks und Pitfalls”

Wenn man mit der SolrCloud arbeitet, stößt man unweigerlich über die clusterstate.json-Datei. Die clusterstate.json-Datei zeigt den aktuellen Status der SolrCloud und wird vom ZooKeeper erstellt und verwaltet. Dieses JSON-Datenformat kann man wunderbar nutzen, um den Status der SolrCloud mittels eigener Analyse- bzw. Monitoring-Tools auszulesen, um, beispielsweise, herauszufinden, ob alle Knoten in der Cloud noch aktiv […]

Weiterlesen

Parametrisierung des DataImportHandlers

Wenn man Daten in Solr indexieren möchte, kommt man fast nicht um den DataImportHandler (DIH) herum. Der DIH ist eine zentrale Komponente in Solr, mit der eine Vielzahl von Datenquellen indexiert werden können, z.B. Datenbanken, Feeds oder das lokale Dateisystem. Dieser Artikel soll primär zeigen, wie man den Import von Daten von außen steuern bzw. […]

Weiterlesen

Solr Caches und Autowarming

Caches sind ein wesentlicher Faktor für die Performance des Search Servers Apache Solr. Nur wer diese Caches, ihre jeweilige Aufgabe und ihre Funktionsweise kennt, kann von Anfang an Performance-Engpässe vermeiden und das Maximale aus seiner Solr Installation herausholen.In Solr gibt es im Gegensatz zur reinen Lucene API mehrere verschiedene Arten von Caches. FilterCache QueryCache DocumentCache […]

Weiterlesen

JUGS Vortrag – Enterprise Search mit Apache Solr

Am 13.09.2012 durften wir Apache Solr als Suchplattform für Enterprise Search im Rahmen eines Vortrages in Stuttgart bei der dort ansässigen Java User Group (JUGS) vorstellen. In diesem Beitrag möchten wir einige interessante Aspekte des Vortrags aufgreifen und eine Zusammenfassung über die Antworten auf die aufgetauchten Fragen geben. Skalierbarkeit von Solr Hat Solr Grenzen, wenn […]

Weiterlesen

Sprachidentifzierung mit Apache Solr

Sprachidentifizerung mit Solr zur Indexierungszeit Solr kann Sprachen während der Indexierung erkennen. Dazu benutzt man den langid UpdateRequestProcessor.Hierzu werden zwei Implementierungen angeboten:Das Feature von Tika Sprachen zu identifizieren: https://tika.apache.org/0.10/api/org/apache/tika/language/LanguageIdentifier.htmlLangDetect Sprachidentifizierung basierend auf einer Java Library: https://code.google.com/p/language-detection/ Konfiguration des UpdateRequestProcessors:Der UpdateRequestProcessor wird in der solrconfig.xml konfiguriert. Es muss zumindest ein Feld, welches Grundlage (also Input) der […]

Weiterlesen