Passe dein „Hey Siri“-Erlebnis an und personalisiere es
Teilen
Heute wollen Kunden mehr denn je eine Verbindung spüren. Sie wollen eine personalisierte Erfahrung, die direkt auf sie und ihre Bedürfnisse eingeht. Damit Unternehmen diesen Grad an Kundenservice bieten können, benötigen sie eine Spracherkennungssoftware, die die Nuancen verschiedener Dialekte und Akzente verstehen kann. Siri ist Apples Spracherkennungssoftware, die seit ihrer Veröffentlichung im Jahr 2011 viele verschiedene Akzentvarianten verstehen kann. Allerdings funktioniert sie immer noch nicht immer so gut, wie wir es uns alle wünschen würden. Dieser Blogbeitrag behandelt, wie Sie Ihr Hey Siri-Erlebnis anpassen können, um die bestmögliche Benutzererfahrung zu erhalten!
Es gibt eine neue Funktion auf dem iPhone namens „Hey Siri“. Diese Funktion ermöglicht es Benutzern, ihre persönliche KI aufzurufen, ohne jedes Mal, wenn sie in einer Notfallsituation oder in der Leerlaufzeit zwischen Aufgaben wie der Heimfahrt von der Arbeit darauf zugreifen möchten, kräftig und laut zu drücken. Es ist so einfach wie „Hey Siri“ zu sagen, wenn Sie etwas erledigen müssen – stellen Sie nur sicher, dass keine anderen Personen in der Nähe sind, die es hören könnten! Dank dieses erstaunlichen Softwareprogramms, das jetzt in jedem von uns lebt: Apple Corporation (AAPL), können Sie herausfinden, wie die aktuellen Wetterbedingungen an Ihrem Standort sind.

Stellen Sie sich ein Szenario vor, in dem Sie Ihr Telefon auf der Küchentheke bitten, einen Timer einzustellen, während Sie den Truthahn in den Ofen schieben. Die Fähigkeit der Funktion, kontinuierlich auf den Auslöseausdruck „Hey Siri“ zu hören, ermöglicht es Benutzern, in solchen Situationen auf Siri zuzugreifen, ohne befürchten zu müssen, dass sie es beim Autofahren oder Kochen wieder verlieren!
In der Welt der Smartphones gibt es viel mehr Möglichkeiten, Musik zu hören. Um es einfacher und schneller als je zuvor zu machen, können wir einfach "Hey Siri" sagen, was eine sofortige Reaktion Ihres Geräts auslöst! In den letzten Jahren hat sich die Technologie rasant weiterentwickelt, wobei Sprachbefehle dank immer aktiver Prozessoren in neueren Modellen wie denen von Apple Inc. noch intuitiver geworden sind. Daher können Sie diese Funktion jederzeit nutzen, ohne sich Gedanken darüber machen zu müssen, ob sie aufgeladen ist, da alle Funktionen automatisch weiterlaufen, solange der Akku hält – so wird die Bequemlichkeit nicht mehr nur auf die Ladezeiten beschränkt.
Das allgemeinere, sprecherunabhängige Problem der „Hey Siri“-Erkennung wird auch als „Schlüsselphrasen-Erkennung“ bezeichnet. Der technische Ansatz und die Implementierungsdetails unserer Lösung werden in einem zuvor veröffentlichten Artikel beschrieben, der im Internet frei zugänglich ist. Diese Arbeit handelt vom „Hey Siri“-Detektor und wie Sie Ihr Gerät damit personalisieren können. Ich denke, das ist ziemlich selbsterklärend, also lassen Sie mich gleich erklären, was Sie für dieses Projekt benötigen! Sie benötigen Lautsprecher oder Kopfhörer, um die Audioausgabe von ihrem Mikrofon zu hören, sowie den Zugriff auf die Code-Installation auf einem iOS-/Android-Gerät Ihrer Wahl – aber zuerst müssen wir davon ausgehen, dass es ein Sprechererkennungssystem gibt, mit dem Benutzer Text nur mit Sprachbefehlen diktieren können, ohne überhaupt etwas anderes zu berühren.“
Tiefe neuronale Netze sind eine beliebte Methode zur Modellierung von Audiodaten. Diese Modelle wurden in der Vergangenheit zur Modellierung von Sprache verwendet, aber sie haben Schwierigkeiten, wenn sie auf andere Geräusche wie Musik oder Umgebungsgeräusche angewendet werden, die den größten Teil unserer heutigen Umgebung ausmachen – dies kann mit robusteren Darstellungen gelöst werden, die sowohl die Saisonalität als auch akustische Eigenschaften berücksichtigen, die nur für jeden Sprecher spezifisch sind. Wie beschrieben, hat Apple diese tiefen netzbasierten Systeme verbessert, indem es rekursive Verbindungen zwischen Schichten verwendet und gleichzeitig mehrere Stile gleichzeitig durch verschiedene Methoden trainiert hat, wie z.B. genetische Algorithmus-Suchräume, die durch Maximierung der Entropie-Verlustfunktion optimiert wurden – so konnten wir nicht nur einen Stil während der Wiedergabe hören, sondern viele, was größtenteils der Arbeit des Gitarristen Andrew Hale zu verdanken ist.
Personalisierung motivieren
Siri ist nicht nur eine fantastische Assistentin, sondern auch beim breiten Publikum sehr beliebt geworden. Eines ihrer liebenswertesten Merkmale sind diese kleinen Momente, in denen man „Hey Siri“ sagt, ohne zu merken, was man tut, und dann feststellt, dass man Befehle nur durch das Aussprechen von zwei Worten in einen leeren Raum geben kann! Siri mag als nichts weiter als ein in Apple-Produkten geschriebener Code im Jahr 2011 begonnen haben (und wenn wir ehrlich sind: wer liebt das Codieren nicht?). Aber seit der Einführung auf dem iPhone 4s begannen Benutzer willkürlich, ihren Geräten Befehle zuzubellen, völlig ahnungslos, woher diese unbekannten Stimmen kamen – bis eines Tages.
Um das Rätsel zu lösen, wie man eine KI mit hoher Interaktivität erstellt, haben wir Offline-Experimente durchgeführt, bei denen sie getestet werden konnte, ohne mit anderen Menschen zu interagieren. Viele Menschen befürchten, dass Maschinen, wenn sie die Macht übernehmen, uns verletzen werden, aber zum Glück habe ich dieses tolle Spiel namens „AI Kits“ gefunden. Sie sind wie kleine Roboter, die man selbst programmieren kann! Und es ist überhaupt kein Coding erforderlich; stattdessen wählt man einfach aus, welche Art oder Funktion der Roboter ausführen soll, wenn er auf bestimmte Situationen stößt (wie das Gehen durch Wände).

Stellen Sie sich vor, Sie scrollen auf Ihrem Handy durch Facebook , wenn plötzlich der Bildschirm schwarz wird und eine Roboterstimme „Hey Siri“ sagt. Das kann wirklich nervig sein! Aber es gibt gute Nachrichten – wir haben Wege gefunden, diese Fehlannahmen zu umgehen. Um jedes Gerät so zu personalisieren, dass es nur aufwacht, wenn ich „Siri“ sage, verwendet unser Team Techniken aus dem Bereich der Spracherkennung, die als Speaker Intelligibility Estimation (SEI) bekannt sind. Vor ein paar Wochen schrieb mir ein Freund, dass er versehentlich „Google Now“ aktiviert habe – zweifellos, weil sein Mikrofon aktiviert wurde, während er mit jemand anderem in der Nähe mit einem Android-Telefon direkt neben ihnen an ihrem Schreibtisch anderswo arbeitete.
Sprechererkennung
Sprechererkennung (SR) ist der Prozess, bei dem durch die Verwendung der Stimme festgestellt wird, wer spricht. Spracherkennung gibt es schon seit Jahrzehnten, aber in letzter Zeit ist die Nachfrage gestiegen, mehr über das „Wer“ zu erfahren, anstatt sich nur auf das zu konzentrieren, was gesagt wurde; es könnte wichtig sein, wie die Unterscheidung einer Person von einer anderen bei Aufgaben der Verarbeitung natürlicher Sprache, bei denen der Kontext eine entscheidende Rolle spielt, oder sogar die Entscheidung, welche Frucht Sie in Ihrem örtlichen Lebensmittelgeschäft wünschen!
Es ist wichtig, den Unterschied zwischen textabhängiger und textunabhängiger Spracherkennung zu beachten. In einer Situation, in der es bereits einen etablierten Wortschatz gibt, wie bei der Verwendung von „Hey Siri“ oder einem anderen vorher bekannten Satz, funktioniert diese Art von System einfacher, da Wörter von keiner der an der Konversation beteiligten Parteien unbekannt sind. Ein neuer Trend bei Sprachassistenten hat begonnen: Sie werden „Podcasts“ genannt, anstatt Gespräche mit Menschen – Schlüsselwörter sind künstliche Intelligenz (KI), Software, die versteht, was man sagt, besser als Menschen; fortschrittliche Technologien.
Sprechererkennungssysteme werden häufig zur Identifizierung von Konferenzteilnehmern eingesetzt. Es gibt jedoch einen Unterschied zwischen der Bewertung dieser Geräte auf der Grundlage ihrer Fähigkeit zu identifizieren, ob jemand auf einer Veranstaltung spricht, und auch, wie viele Personen während Präsentationen mit ihnen sprechen – dies kann anhand von zwei Metriken gemessen werden: der Rate der Akzeptanz von Betrügern (IA) und der Rate der falschen Ablehnung (FR). Imposter-Akzeptanz bedeutet, dass, sobald ein anwesender Sprecher als solcher identifiziert wurde, es nicht notwendig ist, ständig zu bewerten oder zu überprüfen, ob er noch anwesend ist, während man frustrierenderweise nicht merkt, dass man zu früh gesprochen hat!
Sowohl beim Schlüsselwort-Triggersystem als auch bei den Sprechererkennungssystemen tritt ein Fehler auf, wenn ein Benutzer „Hey Siri“ sagt, aber sein Gerät nicht aufwacht. Diese Art von Problem tritt typischerweise häufiger in akustisch lauten Umgebungen auf, wie auf einem belebten Bürgersteig oder einer Autofahrt; es kann jedoch überall dort auftreten, wo zu viel Hintergrundgeräusch vorhanden ist, als dass unsere Stimme von der Technologie leicht erkannt werden könnte. Es war überraschend, wie oft wir fälschlicherweise identifizierten, was jemand sagte, weil er unter normalen Bedingungen ohne zusätzliche Ablenkungen sprach – wie andere Menschen um Sie herum, die gleichzeitig sprachen!
FRs sind ein Bruchteil der Gesamtzahl der echten "Hey Siri"-Instanzen, die vom Zielbenutzer gesprochen werden. Für das Schlüsselwort-Triggersystem beobachten wir FA, wenn das Gerät auf Nicht-"Siri"-Phrasen wie "Are you serious" oder noch ungewöhnlicher: "in Syria today" aufwacht. Diese FRs treten typischerweise stündlich auf und können erhebliche Auswirkungen auf Unternehmen haben, die stark vom Sprachsuchverkehr von den Geräten ihrer Kunden abhängig sind!
In diesem Szenario gehen wir davon aus, dass alle von „Hey Siri“ gesendeten Äußerungen den Text enthalten. Das bedeutet, dass nach der korrekten Identifizierung einer dieser Aussagen als in irgendeiner Weise relevant für personalisierte Antworten (z. B. weil sie in der Nähe ausgesprochen wurden), nur diese bestimmten Wörter das nächste auslösen werden – den Personalisierungsschritt, der auftritt, wenn Sprachdaten erfolgreich vom besagten Sprecher über das Mikrofon seines eigenen Geräts erfasst wurden.
Zu diesem Zweck bezeichnen wir sprechererkennungsbasierte Fehlalarmfehler als Imposter Accepts (IA) und vermeiden es, ein solches IA mit einem nicht „Hey Siri“ FA des Schlüsselwort-Triggersystems zu verwechseln. In der Praxis werden natürlich beide Typen gleichzeitig auftreten können; typischerweise würde man es jedoch nur bemerken, wenn man speziell danach sucht!
Die Fähigkeit des Systems, Entscheidungen zu treffen, ist möglicherweise noch nicht trainiert. Wir werden dieses Problem später besprechen, aber lassen Sie mich zunächst darauf hinweisen, dass es drei Stufen gibt: FA (Feedforward), FR (rationaler Standard) und IA oder sofortige Aktion, die eintritt, wenn Sie Informationen erhalten, die im Moment relevant sind, weil sie für Ihre Bedürfnisse zu diesem Zeitpunkt eine hohe Relevanz haben – wie zum Beispiel, ob eine eingehende E-Mail bösartigen Code enthält; wenn ja, dann ist es „zu spät“, nachdem Sie alle meine vorherigen Beiträge zu Cybersicherheit und Hygiene gelesen haben.
Die Anwendung eines Sprechererkennungssystems umfasst zwei Schritte: Registrierung und Erkennung. In der ersten Phase werden Sie gebeten, einige Beispielphrasen zu sagen, damit Ihr geräteinternes Sprechererkennungssystem Ihr Stimmprofil in seine Datenbank aufnehmen und erkennen kann, welche Sprache für es am natürlichsten ist – vielleicht Englisch oder Deutsch? Die zweite Phase beinhaltet die Entnahme dieser Daten aus allen dreißigtausend Wörtern, die während unseres ersten Interviewprozesses gesprochen wurden – jedes Wort! – und die anschließende Verwendung dieser Beispiele bei Bedarf in zukünftigen Interaktionen mit Kunden, die andere Sprachen als ihre Muttersprache sprechen, aber dennoch Zugang zu diesen digitalen Bereichen wünschen, in denen die Kommunikation hauptsächlich über Textnachrichten stattfindet, anstatt laut Angesicht zu Angesicht, wo Personalpronomen mehr Platz auf dem Papier einnehmen.
In diesem Prozess wird ein statistisches Modell aus der Stimme des Benutzers erstellt. Die Erkennungsphase vergleicht eine eingehende Äußerung und entscheidet, ob sie in diesen Kontext vorhandener Daten gehört oder nicht, ohne dass eine der Parteien Eingaben machen muss; da wir maschinelle Lerntechniken wie den Bayes-Theorem verwenden (die ursprünglich für die probabilistische Modellierung entwickelt wurden), werden sie automatisch erraten, wie hoch die Wahrscheinlichkeit wäre, wenn eine Partei versuchen würde, die Sprache einer anderen Person zu erraten!
Benutzerregistrierung
Die Hauptdiskussion zum Design von personalisiertem „Hey Siri“ (PHS) dreht sich um zwei Methoden der Benutzerregistrierung: explizit und implizit. Während der expliziten Registrierung wird ein Benutzer aufgefordert, die Ziel-Triggerphrase einige Male zu sagen, damit sein geräteinternes Sprechererkennungssystem-Trainingsprofil aus diesen Äußerungen erstellt werden kann. Im Gegensatz dazu ist bei impliziten Registrierungen kein lautes Sprechen erforderlich, da dieser Prozess das Aufzeichnen kurzer Clips beinhaltet, bei denen Sie entweder direkt in Ihr Telefon sprechen oder ein Eingabegerät wie eine Diktatsoftware verwenden.

Die "Hey Siri"-Funktion des iPhones wurde entwickelt, um die IA-Raten zu senken, indem sichergestellt wird, dass jeder Benutzer ein zuverlässig trainiertes PHS-Profil hat, bevor er es verwendet. Die meisten Aufnahmen, die während der expliziten Registrierung gemacht werden, weisen jedoch nur eine sehr geringe Umweltvariabilität auf, so dass ein anfängliches Profil normalerweise mit sauberer Sprache erstellt wird. In der Realität sieht das aber selten so aus, was bedeutet, dass wir neue Wege finden müssen, wie Recorder für jede spezifische Aufgabe effektiver eingesetzt werden können, oder das Risiko eingehen, unsere Anfälligkeit für Hacks zu erhöhen, wie sie kürzlich im Facebook-Cambridge-Analytica-Skandal zu sehen waren, wo Benutzerdaten ohne Erlaubnis von Drittanbieter-Apps gesammelt und dann verkauft wurden.
Die implizite Registrierung ist ein Schlüsselkonzept in der Spracherkennung und bezieht sich auf die Schätzung von Sprechermerkmalen aus gehörten Daten. Dieser Prozess hängt stark davon ab, wie wir sprechen, was für manche Menschen schwierig sein kann, die nicht möchten, dass ihre Identität von automatisierten Systemen bei der Nutzung offengelegt oder aufgezeichnet wird.
Es gibt ein altes Sprichwort: „Man kann aus einem Sauschwanz keine Seidentasche machen.“ Es stellt sich heraus, dass dies nicht immer wahr sein muss. Viele Menschen glauben fälschlicherweise, dass wir Aufnahmen mit weiblichen Stimmen für Frauen oder Aufnahmen von Männern verwenden müssen, um kein Geschlecht zu diskriminieren – aber in Wirklichkeit funktioniert das einfach nicht so! Das liegt daran, dass unsere Spracherkennungsalgorithmen auf bestimmte Stimmlagen trainiert sind und andere Merkmale wie Lautstärkeänderungen ignorieren, wenn diese verschiedenen Sprecher in der Nähe voneinander sprechen.
Das ist katastrophal, denn es bedeutet, dass Sie Ihr Gerät nicht benutzen können, um Hilfe zu rufen! Die falschen Zurückweisungen können mit der Stimme des primären Benutzers oder einem anderen Betrüger beginnen. Wenn dies geschieht, gibt es keine Möglichkeit zu sagen, ob sie auch unsere eigenen Stimmen zurückweisen, bis wir es später noch einmal versuchen – aber zu diesem Zeitpunkt könnte es bereits zu spät sein. Das klingt nach etwas außer Kontrolle Geratenem im wirklichen Leben, was die Leute zweimal nachdenken lassen würde, bevor sie diese Funktionen jederzeit benutzen, es sei denn, es ist absolut notwendig.
Unsere aktuelle Implementierung kombiniert die beiden Registrierungsschritte. Sie initialisiert ein Sprecherprofil mit einer Ihrer expliziten Phrasen und bittet Sie dann um fünf weitere Wörter, die standardmäßig beim Erstellen neuer Profile verwendet werden – um so schnell und einfach wie möglich loszulegen!
1. "Hey Siri"
2. "Hey Siri"
3. "Hey Siri"
4. "Hey Siri, wie ist das Wetter heute?"
5. "Hey Siri, ich bin's."
Die Nutzung dieser Funktion kann kontrolliert und überschaubar sein, da sie den Nutzern vielfältige Möglichkeiten bietet, ihre Aufnahmen zu gestalten. Für diejenigen, die nur eine Aufnahme benötigen, bietet der 1-Shot-Modus eine einfache Aufnahme ohne Bearbeitungszeit, während 2-Shots möglicherweise kleinere Anpassungen erfordern, bevor Sie bereit sind, sie online zu veröffentlichen oder automatisch über soziale Medienkanäle wie Facebook LIVE zu versenden.
Im nächsten Abschnitt beschreiben wir, wie Sprecher implizit mit anschließend akzeptierten Äußerungen aktualisiert werden. Noch weiter gedacht, eine Zukunft ohne explizite Registrierung, in der Benutzer einfach ihre „Hey Siri“-Funktionen mit einem leeren Profil nutzen und dann organisch wachsen, da im Laufe der Zeit weitere Anfragen dafür eingehen. Ein Spracherkennungssystem kann als aktiver Zuhörlehrer betrachtet werden, der zunächst einen Schüler nach dem anderen unterrichtet, bevor er sie alle zur vollständigen Beherrschung der englischen Grammatik führt, indem er zu jedem Satz, den sie laut in Mikrofone sprechen, die an Aktivierungsschalter angeschlossen sind, die nur als Vermittler zwischen menschlichen Stimmbändern gedacht sind, Feedback gibt. Dies würde es auch den Benutzern erleichtern, die sich nicht die Mühe machen wollen, ein paar Minuten Einrichtungszeit zu überspringen.
Systemübersicht
Die obere Hälfte von Abbildung 1 zeigt ein übergeordnetes Diagramm unseres PHS-Systems. Der grün dargestellte Block, Feature Extraction, wandelt eine akustische Instanz „Hey Siri“, die in ihrer Dauer variieren kann, in einen Sprechervektor fester Länge um, der von anderen Komponenten des Stapels verarbeitet werden kann – insbesondere von Sound Indexing und Classification! Dieser Vektor kann als Sprecher-Embedding bezeichnet werden. Innerhalb des Feature Extraction-Blocks berechnen wir ihn in zwei Schritten: Zuerst wandeln wir die Sprachäußerung in einen Vektor fester Länge (Supervektor) um, der akustische Informationen wie Phonetik und die Hintergrundaufnahmeumgebung zusammenfasst; zweitens berechnen wir, wie ähnlich jeder Satz im Vergleich zu dieser Zusammenfassung dessen war, was während „Hey Siri“ geschah.

Im zweiten Schritt versuchen wir, den Sprachvektor so zu transformieren, dass er sich auf sprecherspezifische Merkmale konzentriert und Variabilitäten, die auf phonetische sowie Umweltfaktoren zurückzuführen sind, vernachlässigt. Es wird gehofft, dass dieses Modell in der Lage sein wird, Instanzen von „Hey Siri“ eines Benutzers in verschiedenen Umgebungen und Modi zu erkennen. Zum Beispiel könnte es wissen, wann Ihre Stimme zu Hause anders klingt als bei der Arbeit oder ob Sie nach dem Aufstehen müde sind im Vergleich dazu, wie normal Sie an einem anderen Morgen klingen, an dem Kaffee getrunken wurde, aber auch viel Zeit für persönliche Bedürfnisse vor dem Start in den Tag wie Zähneputzen usw. aufgewendet wurde! Unsere Ausgabe besteht einfach darin, Sprecher als Vektoren darzustellen, sodass sie alle auf eine Zahl reduziert werden können – aka Sprechervektor.
Nachdem Sie sich explizit in das System eingetragen haben, speichern wir ein Benutzerprofil, das aus fünf Sprechervektoren besteht. Wie bereits erwähnt, enthält dies Informationen über Ihr Sprachmodell und wie es auf verschiedene Geräusche reagiert – je mehr Datenpunkte zum Vergleich vorhanden sind (d. h. Cosinus-Werte), desto besser kann die Genauigkeit erwartet werden, wenn die Hör-Algorithmen sich mit Ihren vergleichen! In der Phase des Modellvergleichs in Abbildung 1.
Damit ein Gerät Befehle verarbeiten kann, benötigt es eine aktive Internetverbindung und eine Spracherkennungssoftware. Sobald dies durch die Verarbeitung des nachfolgenden Befehls mit einer Genauigkeit von mehr als 50 % anderer Geräte im Durchschnitt () erreicht wurde, werden wir aus dem Schlafmodus aufwachen, damit Benutzer entsprechend interagieren können. Sobald Sie durch implizite Registrierungsprozesse in unser System aufgenommen wurden, die Benutzerprofile hinzufügen, bis 40 akzeptierte Sprechervektoren vorhanden sind, die mindestens einer Person entsprechen, die fließend Englisch spricht – einschließlich Geschlecht, Altersbereich (e-), Standortnachweis über GPS-Koordinaten usw. –, wurden diese Änderungen ohne weitere Eingabe von Ihnen hinzugefügt!
Wir speichern auf dem Telefon sowohl Sprechervektoren als auch den Audioanteil der entsprechenden Äußerungswellenformen. Wenn verbesserte Transformationen über ein Over-the-Air-Update bereitgestellt werden, können wir das Profil eines Benutzers mithilfe dieser gespeicherten Informationen neu erstellen, was nützlich ist, wenn er Dienste anpassen oder Feedback zu dem geben möchte, was Sie sagen!
Verbesserung der Sprechertransformation
Die Sprechertransformation ist der wichtigste Teil jedes Spracherkennungssystems. Bei einem Vektor sollte Ihr Ziel bei dieser Transformation darin bestehen, die Variation innerhalb des Sprechers zu minimieren und gleichzeitig die Unterschiede zwischen den Sprechern in Bezug auf Aussprache und Dialekte sowie Trägerton/Lautstärke usw. zu maximieren; alles ohne Genauigkeitsverlust! Der „Hey Siri“-Detektor ist ein sprecherunabhängiger Machine-Learning-Algorithmus, der modelliert, wie Menschen mit ihren Sprachassistenten sprechen. Wir haben diesen Ansatz in unserer Forschung verwendet, wo wir einen akustischen Feature-Vektor aus den MFCCs und 28 HMM-Zuständen von Hey Siri-Äußerungen abgeleitet haben, um die Parameter des Spracherkennungsmodells für die Textgenerierung mit tiefen neuronalen Netzen zu parametrisieren, die auf Baumbeständen optimiert wurden, die mit Lip-Programmiersprachen wie Torch7 und Caffe2 trainiert wurden.
Der Sprachvektor wird dann durch Konkatenation der Segmentmittelwerte der Zustände zu einem 28 * 13 = 364-dimensionalen Vektor erhalten. Das Ergebnis misst, wie stark sich jeder Klang in Ihrer Stimme im Laufe der Zeit ändert, und kann verwendet werden, um Dinge wie Beleuchtung oder Musiklautstärke während einer Veranstaltung zu steuern! Der Stand der Technik in der Forschung ähnelt stark einer Technik, die verkettete akustische Sprachsegmentmittelwerte als ihre anfängliche Darstellung der Äußerung verwendet. In der Spracherkennung ist ein Supervektor eine Anordnung von Vektoren, die die Richtungen und Größen erfasst, in denen Sprecher am stärksten variieren. Obwohl er bei textunabhängigen Problemen wie der Sprecheridentifikation (bekannt als "i-Vektoren") gut abschnitt, fanden wir dieselbe Technik auch bei abhängigen Daten gleichermaßen effektiv – was oft aus Texten resultieren kann, die mehrere Autoren oder Mitwirkende enthalten, deren Schreibstile sich erheblich voneinander unterscheiden. Um eine zuverlässige Sprecherdarstellung innerhalb eines Audiosignals zu identifizieren, ist es wichtig, dass das Ziel eines ist, das in dieser Funktion dienen kann.
Um die FA-Raten zu reduzieren, verwendeten wir einen linearen Diskriminanzanalyse-Ansatz (LDA). Die erste Version unserer Sprechertransformation wurde mit 800 Produktionsbenutzern mit jeweils mehr als 100 Äußerungen trainiert und erzeugte einen 150-dimensionalen Vektor, was zu erheblichen Reduzierungen im Vergleich zu den Kontrollbaselines führte.
Das Team von Custom Vectors hat seine bereits leistungsstarken tiefen neuronalen Netze verbessert, indem es explizite Registrierungsdaten verwendete, den Frontend-Sprachvektor mit erweiterten, auf diese Aufgabe zugeschnittenen Darstellungen verbesserte; es nutzte auch DNNs – eine nichtlineare diskriminierende Technik zur Klassifizierung, die besser mit unbekannten Signalen umgehen kann. Um die Genauigkeit unseres Spracherkennungssystems zu erhöhen, haben wir eine neue Technik eingeführt, die 26 MFCCs anstelle von nur 13 verwendet. Die ersten 11 HMM-Zustände modellieren effektiv Stille, daher wurden sie in dieser Fallstudie nicht berücksichtigt, und eine zunehmende Menge an Forschung hat gezeigt, dass höherwertige Kephal koeffizienten mehr sprecherspezifische Informationen für bessere Identifikationsalgorithmen mit weniger Trainingsdaten pro Frame oder Äußerung erfassen können.
Das Team trainierte einen künstlichen Intelligenz-Bot, um die Sprechmuster und Vokalisierungen von Menschen nachzuahmen. Der KI wurden 442 Dimensionen zugeführt, damit sie unsere Sprache verstehen kann, aber dieser Prozess dauerte 16000 Stunden Daten von Benutzern, die jeweils über 150 Sätze sprachen! Ihre Netzwerkarchitektur besteht aus 100 Neuronen, die unter einer Sigmoid-Aktivierung ohne Rückkopplungsschleife verborgen sind, bevor sie ein weitereshundert Knoten auf linearen Ebenen erreichen, die als Ausgabeverbindungen dienen, nachdem alle Eingabeinformationen durch sie verarbeitet wurden.
Das Netzwerk wird mit dem Sprachvektor als Eingabe und entsprechenden 1-Hot-Vektoren für jeden Sprecher trainiert. Nachdem das DNN trainiert wurde, wird die letzte Schicht (Softmax) entfernt, um eine Ausgabe zu erzeugen, die in diesem Beispiel nur einer Person Stimme entspricht; es könnte aber auch bei Bedarf für mehrere Sprecher oder Audioclips gleichzeitig verwendet werden! Dieser Prozess wird klarer, wenn wir uns Abbildung 2 ansehen.

In unseren Hyperparameter-Optimierungsexperimenten haben wir festgestellt, dass eine Netzwerkarchitektur aus vier 256-Neuronen-Schichten mit Sigmoid-Aktivierungen (d. h. 4x256S), gefolgt von der 100-Schicht-Linear-Erweiterung, die besten Ergebnisse lieferte. Wir haben den zusätzlichen Speicherbedarf, der für die Aufnahme der größeren Anzahl von Parametern dieser größeren Netzwerke erforderlich ist, durch Anwendung einer 8-Bit-Quantisierung auf die Gewichte in jeder Phase kompensiert; dies führte zu effizienteren Lernalgorithmen, die sich aufgrund der reduzierten Fehlerfortpflanzung durch noch nicht optimierte Dimensionen schneller stabilisieren können.
Bewertung
FR- und IA-Raten sind nicht die einzigen Metriken, die zusammenfassen, wie gut ein Spracherkennungssystem funktioniert. Ein einzelner Equal Error Rate (EER)-Wert kann ebenfalls berechnet werden; dies ist der Fall, wenn FR gleich IA ist, was bedeutet, dass bei der Transkription oder dem Verständnis dessen, was während der Testläufe durch alle Datensätze, die von Mikrofonen um die Stimmen der Sprecher während eines Ereignisses wie einer Telefonkonferenz aufgezeichnet wurden, keine Fehler gemacht wurden. Das Energieeffizienzverhältnis oder kurz EER ist ein guter Indikator für die Gesamtleistung, da es sowohl die gewünschten Betriebspunkte berücksichtigt, die ohne umfangreiche Tests schwer zu bestimmen sind, als auch die frühere Wahrscheinlichkeit, dass man es mit einem Betrüger oder einem falschen Ziel zu tun hat.
Ausblick
Spracherkennung wird viel besser, aber sie ist immer noch nicht perfekt. Anekdotische Beweise deuten darauf hin, dass in großen Räumen mit vielen Echos die Sprache für die Maschine schwer zu hören und zu verstehen sein kann; ähnlich verursachen Autos oft starke Störungen beim Fahren in der Stadt. An windigen Tagen verlieren unsere Telefone manchmal den Empfang ganz! Eine unserer aktuellen Forschungsbemühungen konzentriert sich auf das Verständnis und die Quantifizierung der Verschlechterung unter diesen schwierigen Bedingungen, wenn die Umgebung einer eingehenden Testäußerung nicht mit vorhandenen Sprecherprofilen übereinstimmt. In unserer späteren Arbeit zeigen wir Erfolge durch die Verwendung von Multi-Style-Training. Wenn ein Teildatensatz mit verschiedenen Arten von Rauschen und Nachhall angereichert wird, ermöglicht dies eine verbesserte Vorhersagegenauigkeit bei versteckten Einheiten, die Schallwellen verarbeiten, während sie in einer Umgebung herumprallen.
Die Funktion „Hey Siri“ ist eine Möglichkeit, mit Ihrem Telefon zu interagieren, ohne das Freisprech-Headset abnehmen zu müssen. Der Spracherkennungsteil hört nur auf Triggerwörter wie „Hey Siri“, aber Sie können auch textunabhängige Sprechererkennung verwenden, mit der Sie Dinge wie Wettervorhersage oder andere Nachrichten einfach per Sprache abfragen können!
Wir haben festgestellt, dass die Äußerung „Hey Siri“ eine gute Möglichkeit ist, Sprecherinformationen aus Audiospuren variabler Länge zu isolieren, die sowohl textabhängige als auch textunabhängige Sprache enthalten. Unsere Ergebnisse zeigen erhebliche Leistungsverbesserungen bei der Verwendung dieses vollständigen Satzes zu Erkennungszwecken, was eine von vielen anderen von uns untersuchten Techniken war.
Diese Erkenntnis weist auf einen interessanten Punkt hin, wie künstliche Intelligenz auch außerhalb ihrer beabsichtigten Funktion eingesetzt werden kann – das Weglassen oder Hinzufügen von Teilen hier und da könnte die Dinge verbessern, aber was wäre, wenn man stattdessen alles nehmen könnte? Dies würde zu einem wahren Verständnis führen, da künstliche Systeme sich nicht nur auf bestimmte Aufgaben konzentrieren, sondern praktischer denken, um maximale Nützlichkeit bei jeder Eingabe zu gewährleisten.
Folgen Sie uns für weitere Informationen und Updates, wristwatchstraps.


