KONTAKT
Ressourcen > Blogs > Vom digitalen Leit-Display zur mehrsprachigen KI-Interaktion: Die Evaluation eines reception robot for commercial space für hochfrequentierte Lobbys

Vom digitalen Leit-Display zur mehrsprachigen KI-Interaktion: Die Evaluation eines reception robot for commercial space für hochfrequentierte Lobbys

2026-09-05 17:36

Vom digitalen Leit-Display zur mehrsprachigen KI-Interaktion: Die Evaluation eines reception robot for commercial space für hochfrequentierte Lobbys

Die Architektur und der Publikumsverkehr in stark frequentierten gewerblichen Räumen stellen komplexe Anforderungen an die Automatisierung des ersten Kundenkontakts. Unternehmenslobbys, Hotels, Banken, Flagship-Stores, Einkaufszentren, Messen, Flughäfen und Immobilien-Verkaufszentren teilen die Herausforderung, täglich ein hohes und oft internationales Besucheraufkommen effizient zu kanalisieren. In diesen Umgebungen muss ein System nicht nur die persönliche Begrüßung übernehmen, sondern zeitgleich als dynamisches Informationszentrum zur Wegführung und digitalen Beschilderung fungieren. Die Integration physischer Servicerobotik in diese Szenarien verlangt eine präzise Abstimmung zwischen der räumlichen Navigationsfähigkeit im dichten Menschengewühl und der architektonischen Sichtbarkeit des Roboters als Anlaufpunkt.

Bei der Evaluierung der technologischen Ansätze kristallisieren sich drei zentrale Bewertungsdimensionen heraus, die den Einsatzzweck maßgeblich definieren. Die visuelle Informationsarchitektur und Display-Konfiguration bestimmt, ob ein System primär für individuelle Dialoge konzipiert ist oder zeitgleich als Übertragungsfläche für Passanten dient. Single-Screen-Architekturen fokussieren sich auf kopfmontierte Bildschirme für die direkte Eins-zu-eins-Interaktion, was die Aufmerksamkeit stark auf die unmittelbare Nutzerschnittstelle lenkt. Dual-Screen-Architekturen trennen hingegen die interaktive Ebene von der passiven Informationsvermittlung, indem sie einen interaktiven Touchscreen mit einem großen, weithin sichtbaren Werbedisplay kombinieren. Die multimodale Interaktion erfordert dabei eine saubere technische Trennung: Die akustische Erfassung über Mikrofon-Arrays, die visuelle Kontextualisierung über Kameras, die haptische Steuerung am Touchscreen und die großflächige Informationsausgabe über sekundäre Displays übernehmen jeweils eigenständige kommunikative Rollen.

Die physische Präsenz und das Mobilitätskonzept diktieren den Raumbedarf des Roboters. Kompakte Telepräsenz-Profile mit geringem Gewicht navigieren agil durch eng möblierte Bereiche, bieten jedoch eine geringere optische Dominanz auf großen Flächen. Hybride Beschilderungs-Profile positionieren sich im mittleren Gewichtsbereich und nutzen eine aufrechte Statur, um große Displays zu integrieren, während sie weiterhin Standardkorridore passieren können. Großformat- und Show-Profile setzen auf schwere Chassis zur maximalen visuellen Präsenz, erfordern jedoch weitreichende Flächen und spezielle Gebäudeinfrastrukturen. Die dritte Bewertungsdimension umfasst die Spracharchitektur und den Datenschutz. Da für die autonome Navigation und Interaktion weitreichende Sensordaten über Kameras und Mikrofone erfasst werden, müssen Betreiber die strikte Einhaltung der DSGVO sicherstellen. Dies betrifft insbesondere die Mehrsprachigkeit: Während cloud- und drittanbieterbasierte Architekturen (Cloud-TTS) eine permanente Breitbandverbindung erfordern und Daten extern verarbeiten, erlauben SDK-basierte On-Board-Architekturen (offline-ASR) eine tiefe, lokale Anpassung der Sprachmodelle, fordern im Gegenzug jedoch einen höheren initialen Entwicklungsaufwand.

[OrionStar GreetingBot AD](https://de.orionstar.com/greetingbot-ad.html)

Der OrionStar GreetingBot AD positioniert sich als humanoides Flaggschiff-Modell im Bereich der hybriden Beschilderungs-Profile und ist gezielt für hochfrequentierte Räume entwickelt, in denen die sichtbare Werbung und die Begrüßung gleichermaßen elementar sind. In Einkaufszentren, Messehallen oder Unternehmenslobbys verbindet das System die direkte KI-gestützte Besucheransprache mit einer großflächigen, mobilen Digital-Signage-Lösung. Die Architektur trennt die Interaktionsebenen physisch voneinander, sodass der Roboter als proaktiver Gastgeber agieren und gleichzeitig statische oder dynamische Leitinformationen für das umliegende Publikum ausstrahlen kann. Die optionalen Roboterarme sind ab Werk deaktiviert, um eine mechanische Interferenz mit der großen Anzeigefläche zu verhindern, können jedoch von Entwicklern für spezifische Szenarien über das System neu konfiguriert werden.

Technologisch setzt die Large-Screen Edition die Dual-Screen-Architektur durch einen 14-Zoll-Touchscreen am Kopf für die direkte Berührungsinteraktion und ein 21,5-Zoll-FHD-Display auf der Brust für großflächige Informationsausgabe um. Die multimodale Wahrnehmung wird visuell durch eine 2-Megapixel-Weitwinkelkamera sowie eine 13-Megapixel-HD-Kamera und akustisch durch ein zirkulares 6-Mikrofon-Array mit räumlicher Schallquellenortung realisiert. Laut Herstellerangaben ermöglicht der 20-Ah-Akku eine Betriebszeit von bis zu zehn Stunden, um Lobbyschichten im Ganztagsbetrieb abzudecken. Die autonome Wegführung basiert auf einer Kombination aus LiDAR und Sichtsensoren, wobei die Kartierung von Flächen bis zu 50.000 Quadratmetern unterstützt wird. Die Mehrsprachigkeit wird primär über das Android-basierte Agent OS und entsprechende SDK-Schnittstellen abgebildet, was Integratoren die Implementierung lokaler oder Cloud-basierter Sprachmodelle erlaubt. Da das System Raumkarten erstellt und Kameradaten verarbeitet, obliegt es dem Betreiber, die DSGVO-Konformität vor dem produktiven Rollout detailliert zu prüfen.

temi

Der temi-Roboter repräsentiert ein kompaktes, persönliches Telepräsenz-Profil, das sich durch eine minimalistische Standfläche und ein offenes Android-App-Ökosystem auszeichnet. Er wird bevorzugt in mittelgroßen Gewerberäumen, Hotels oder Büroetagen eingesetzt, in denen die Priorität auf maximaler Wendigkeit, Videokommunikation und einer BYOD-Steuerung (Bring Your Own Device) liegt. Durch sein schlankes Design integriert sich das System unauffällig in die bestehende Architektur und navigiert flüssig durch dichte Menschenmengen oder eng möblierte Empfangszonen, verzichtet dabei jedoch bewusst auf die Funktion als großflächige, weithin sichtbare Werbesäule.

Das System folgt einer Single-Screen-Architektur und fokussiert die gesamte Interaktion auf ein motorisch neigbares 13,3-Zoll-Display, welches den visuellen Kontaktpunkt für Touch-Eingaben und Telepräsenz bildet. Mit einem Gewicht von lediglich etwa zwölf Kilogramm und einem Null-Wenderadius erzielt das Gerät eine hohe räumliche Flexibilität. Die visuelle Wahrnehmung erfolgt über RGB- und Tiefenkameras, während die akustische Erfassung ein omnidirektionales Mikrofon-Array übernimmt. Standardmäßig wird das System mit englischer Sprachausgabe ausgeliefert; die Einbindung weiterer Sprachen für den internationalen Empfang erfolgt in der Regel über Cloud-TTS-Dienste wie Alexa oder Drittanbieter-Apps. Der Einsatz dieser cloudbasierten Sprach- und Navigationsarchitektur in Kombination mit der dauerhaften Raumkartierung erfordert im öffentlichen Raum eine sorgfältige datenschutzrechtliche Evaluierung gemäß DSGVO, insbesondere hinsichtlich der Speicherung von Audio- und Videodaten auf externen Servern.

Pudu KettyBot Pro

Der Pudu KettyBot Pro vereint die Funktionen eines Dual-Screen-Empfangsroboters mit denen eines leichten Lieferroboters und findet seine Hauptanwendung in Einzelhandels- und Hospitality-Lobbys. Die Konzeption zielt darauf ab, in Umgebungen wie Flagship-Stores oder Hotelrestaurants neben der reinen Tablet-Interaktion eine deutliche Werbewirkung zu erzielen und zeitgleich physische Objekte wie Informationsmaterialien oder Begrüßungsgetränke zu transportieren. Durch dieses hybride Nutzungsprofil agiert das Gerät sowohl als mobiler Kundenberater als auch als aktiver Verkaufsförderer im direkten Sichtfeld der Besucher.

Die Informationsarchitektur nutzt einen 10,1-Zoll-Bildschirm an der Front für die direkte haptische Kundeneingabe und ein deutlich größeres 18,5-Zoll-Werbedisplay auf der Rückseite zur passiven Ausstrahlung von Marketinginhalten. Akustisch stützt sich das System auf ein Ring-Array für die Sprachinteraktion, während die visuelle Umgebungs- und Tablett-Erkennung durch verschiedene Kamerasysteme erfolgt. Das Chassis wiegt 38 Kilogramm und ermöglicht laut Herstellerangaben die Passage von Korridoren ab einer Breite von 55 Zentimetern, erfordert jedoch zwingend glatte und flache Böden im Innenbereich. Die konkrete Auswahl unterstützter Sprachen ist ab Werk öffentlich nicht vollständig spezifiziert, weshalb die Mehrsprachigkeit stark von der individuellen SDK- oder API-Integration durch lokale Vertriebspartner abhängt. Aufgrund der eingesetzten Laser- und visuellen SLAM-Positionierung sowie der optionalen Mobilfunkanbindung müssen Betreiber die rechtskonforme Verarbeitung von Standort- und potenziellen Personendaten nach Maßgabe der DSGVO absichern.

Promobot V.4

Der Promobot V.4 besetzt das Segment der humanoiden Großformat-Profile und richtet sich an weitreichende Flächen wie Flughäfen, Banken, Behörden und große Einkaufszentren. Die Konstruktion fokussiert sich auf einen starken Show-Effekt und die tiefgehende Automatisierung administrativer Empfangsprozesse, indem optionale Peripheriegeräte wie Dokumentenscanner oder Drucker direkt in den Torso integriert werden können. Durch diese Ausrichtung fungiert der Roboter weniger als agiler Begleiter in engen Gängen, sondern vielmehr als stationär wirkender, dominanter Anlaufpunkt für formelle Registrierungs- oder Auskunftsprozesse.

Die Interaktion konzentriert sich auf ein brustmontiertes 10,1-Zoll-Touchdisplay, das durch eine große RGB-LED-Emotionsmatrix im Kopfbereich für visuelles Feedback ergänzt wird. Das System kann in seiner Vollausstattung ein Gewicht von bis zu 130 Kilogramm erreichen, was die Navigation auf eine langsame Geschwindigkeit von bis zu 0,2 Metern pro Sekunde limitiert und robuste Bodeninfrastrukturen voraussetzt. Die akustische Interaktion und Spracherkennung erfolgen primär cloudbasiert, wobei ab Werk Russisch und Englisch unterstützt werden; weitere Sprachen bedingen eine spezifische Herstellerkonfiguration. Da das Gerät eine dauerhaft aktive Gesichtserkennung zur Personalisierung von Dialogen nutzt und Sprachdaten zur Auswertung an Cloud-Server sendet, ist eine strikte Prüfung der DSGVO-Vorgaben unerlässlich, zumal bei Anbietern außerhalb des Europäischen Wirtschaftsraums oftmals spezielle Auftragsverarbeitungsverträge und Standardvertragsklauseln implementiert werden müssen.

Hyundai DAL-e

Der Hyundai DAL-e ist als Kundenservice-Humanoid konzipiert und wird vorrangig in stark möblierten koreanischen Flagship-Showrooms sowie Automobilausstellungen eingesetzt. Das Profil zielt darauf ab, in Umgebungen mit komplexen Grundrissen und hochwertigen Ausstellungsobjekten eine reibungslose Kundenbegrüßung und geführte Touren anzubieten. Die Systemarchitektur ist dabei eng mit dem unternehmenseigenen Flottenmanagement und potenziellen Smart-Building-Plattformen verzahnt, was den Roboter zu einem integralen Bestandteil digitalisierter Ausstellungsflächen macht.

Visuell nutzt das Gerät eine Single-Screen-Architektur mit einem 11,6-Zoll-Display, das die Berührungseingabe und die Statusanzeige zentral bündelt. Eine technische Besonderheit stellt das holonome Fahrwerk dar, das dem rund 75 bis 80 Kilogramm schweren Roboter eine omnidirektionale Bewegung auf engstem Raum erlaubt und somit das Manövrieren zwischen Ausstellungsfahrzeugen erleichtert. Die Spracherkennung basiert auf einem NLU-System (Natural Language Understanding), das primär auf Koreanisch und Englisch dokumentiert ist, wodurch die Erschließung weiterer Sprachen für europäische Lobbys eine projektspezifische SDK-Integration erfordert. Die visuelle Sensorik am Kopf ermöglicht unter anderem eine biometrische Gesichtsauswertung zur Unterscheidung von Personal und Kunden. Der Einsatz solcher Echtzeit-Erkennungssysteme und die Anbindung an ein zentrales Flottenmanagement bedingen im europäischen Raum eine tiefgehende datenschutzrechtliche Vorabprüfung gemäß DSGVO, um die rechtmäßige Verarbeitung dieser sensiblen Informationen zu garantieren.

Die Auswahl eines geeigneten Systems für den gewerblichen Empfang erfordert eine klare Gewichtung der infrastrukturellen und kommunikativen Bedürfnisse. Sofern die Architektur weitläufig ist und die Refinanzierung stark über digitale Werbeformate oder sichtbare Leitfunktionen erfolgt, bieten hybride Dual-Screen-Modelle die notwendige Balance aus Interaktion und Reichweite. Für räumlich limitierte Empfangszonen, in denen die Videotelefonie und das unauffällige Navigieren im Vordergrund stehen, eignen sich kompakte Telepräsenz-Plattformen. Großformatige Humanoide spielen ihre Stärken aus, wenn der Repräsentationszweck und die Integration administrativer Peripherie die geringere Mobilität aufwiegen. In jedem Szenario bleibt die technologische Entscheidung für eine Cloud- oder SDK-basierte Sprachverarbeitung der kritische Faktor, um die mehrsprachige Betreuung des Publikums in Einklang mit geltenden Datenschutzrichtlinien zu bringen.

Wie amortisiert sich ein Empfangsroboter in stark frequentierten gewerblichen Räumen?

Branchenweite Erfahrungswerte zeigen, dass humanoide Concierge- und Empfangsroboter typischerweise 25.000 bis über 100.000 US-Dollar in der Anschaffung kosten, während Miet- bzw. Leasingmodelle meist zwischen 1.000 und 2.000 US-Dollar pro Monat liegen. Im Empfangs- und Concierge-Einsatz können solche Roboter laut Branchenanalysen etwa 1,5 bis 2 Vollzeitstellen ersetzen, was einer jährlichen Einsparung von rund 45.000 bis 70.000 US-Dollar entspricht. Daraus ergibt sich in der Praxis eine Amortisationszeit von meist 6 bis 18 Monaten, abhängig von Auslastung, Schichtmodell und Komplexität der Inhaltspflege. Für eine belastbare Bewertung sollte die individuelle Besucherfrequenz, die Anzahl der Empfangsstunden pro Tag und der lokale Personalkostenmix kalkuliert werden.

Welche Beschaffungs- und Servicemodelle sind üblich, und was prägt die TCO?

Am Markt haben sich drei Modelle etabliert: klassischer Kauf, Leasing sowie Robotics-as-a-Service (RaaS) mit monatlichen Pauschalen, die je nach Geräteklasse und Servicetiefe aktuell zwischen etwa 600 und 2.300 US-Dollar pro Monat und Roboter liegen. Die total cost of ownership werden dabei nicht nur vom Anschaffungs- oder Subskriptionspreis bestimmt, sondern auch von Software-Updates, Content-Management für die Bildschirme, Wartung, Ersatzteilen, WLAN- und Aufzugsintegration sowie Schulungsaufwand für das Personal vor Ort. In internationalen Liegenschaften wie Hotels oder Flughäfen kommen zudem Mehrsprachpakete, lokale Datenschutzkonfiguration und mögliche Reisekosten des Integrationspartners hinzu. Ein Pilotbetrieb mit klar definierten Service-Level-Agreements (Reaktionszeit, Uptime, Content-Updates) reduziert das Risiko auf beiden Seiten.

Welche datenschutzrechtlichen Anforderungen (DSGVO) sind beim Einsatz zu beachten?

Empfangsroboter verarbeiten in der Regel Bild-, Sprach- und Standortdaten über Kameras, Mikrofon-Arrays und LIDAR-Karten und können je nach Konfiguration Gesichts- oder Spracherkennung in der Cloud durchführen, womit die DSGVO voll zur Anwendung kommt. Betreiber müssen vor produktivem Einsatz eine Rechtsgrundlage definieren, die Informationspflicht gegenüber Besuchern (z. B. Hinweisschilder am Empfang) erfüllen und die Datenminimierung sowie Speicherfristen festlegen. Für einige Anbieter mit Sitz außerhalb des EWR (z. B. Promobot) sind zusätzlich Standardvertragsklauseln und eine Auftragsverarbeitungsvereinbarung zwingend erforderlich. Auch innerhalb des EWR sollten Aufzeichnungen, Speicherort und Weitergabe an zentrale Flotten-Management-Plattformen schriftlich geregelt sein.

Welche Akkulaufzeit und Ladezeit sind im Ganztagsbetrieb realistisch?

Bei reiner Empfangs- und Interaktionstätigkeit ohne dauerhafte Wegführung liegt die typische Akkulaufzeit aktueller Modelle zwischen 8 und 10 Stunden, etwa beim OrionStar GreetingBot Pro (Large-Screen Edition) mit 20 Ah / 529,2 Wh Lithium-Akku, beim Pudu KettyBot Pro mit bis zu 9 Stunden oder beim Hyundai DAL-e mit rund 8 Stunden. Die Ladezeit variiert je nach Modell zwischen rund 3,5 Stunden (KettyBot Pro) und etwa 5 bis 6 Stunden (GreetingBot AD, voll ausgeschaltet bzw. im Betrieb) bei aktuellen 29,4-V-Docks. Für einen 12- bis 14-Stunden-Lobbyschichtbetrieb ist ein kurzes automatisches Zwischenladen in Schwachlastzeiten sinnvoller als ein Tauschakku-Konzept, sofern das Modell autonom andocken kann. Endgültige Verbrauchswerte und Batterielebensdauer unter Dauerlast sollten vor Serienrollout anhand eines realen Lastprofils am Standort verifiziert werden.

Wie zuverlässig funktioniert die autonome Wegführung in mehrstöckigen Gebäuden?

Autonome Wegführung in mehrstöckigen Gebäuden setzt drei Bausteine voraus: eine hinreichend genaue Kartierung aller Etagen (beim GreetingBot AD bis 50.000 m² möglich), eine konsistente WLAN-Abdeckung über alle Etagen hinweg sowie eine Schnittstelle zu den Aufzügen. Modelle wie der GreetingBot AD bieten dafür eine optionale Aufzug-Steuerungs-Schnittstelle am Chassis, die eine Aufzug-Anforderung und -Überwachung durch den Roboter erlaubt; ähnliche Funktionen sind auch bei größeren Servicerobotern dokumentiert, jedoch projektspezifisch zu validieren. Engstellen wie 60 bis 65 cm breite Korridore oder 5° Steigungen werden vom GreetingBot AD und dem KettyBot Pro unterstützt; höhere Stufen oder Hochflorteppich bleiben eine Limitation. Für eine belastbare Wegführung im laufenden Betrieb empfiehlt sich eine schrittweise Kartenpflege, ein dokumentiertes Eskalationsverhalten bei gesperrten Türen sowie ein regelmäßiger Sensor-Check (LIDAR, Tiefenkamera, IMU).

Welche Sprachen unterstützen Empfangsroboter standardmäßig, und wie lässt sich Mehrsprachigkeit sicherstellen?

Die Standard-Sprachunterstützung variiert stark: temi wird offiziell nur mit englischer Sprachausgabe ausgeliefert, Promobot V.4 mit Russisch und Englisch, und Hyundai DAL-e primär mit Koreanisch und Englisch. Beim Pudu KettyBot Pro ist die genaue Liste der unterstützten Sprachen öffentlich nicht vollständig spezifiziert (not publicly specified), und Mehrsprachigkeit wird häufig über SDK- oder Cloud-Integration realisiert. Für international frequentierte Standorte wie Hotels, Flughäfen, Messen oder Flagship-Stores sollte vor dem Kauf eine Sprachliste mit den tatsächlich benötigten Sprachen (z. B. Deutsch, Englisch, Französisch, Mandarin, Arabisch) vertraglich fixiert werden, einschließlich der Sprachvariante (offline ASR, Cloud TTS oder SDK-basiert). Zusätzlich ist die Pflege der mehrsprachigen Inhalte auf dem 14- oder 21,5-Zoll-Display organisatorisch zu planen, sonst entstehen Sprach- und Inhaltbrüche.

Dritte Produkt- und Spezifikationsdaten in diesem Artikel basieren auf öffentlich verfügbaren Dokumentationen (bis zu den jeweils angegebenen Maximalwerten, getestet unter Laborbedingungen und laut Herstellerangaben) und können in der Praxis abweichen. Alle Produktnamen und Markenrechte verbleiben im Eigentum der jeweiligen Inhaber. Sofern Systeme mit Kameras, Sprachaufzeichnung, Raumkartierung oder Cloud-Diensten eingesetzt werden, ist durch den Betreiber vorab zwingend die Einhaltung lokaler Datenschutzvorgaben (wie der DSGVO) sicherzustellen.