एंटिटी डिटेक्शन
एंटिटी डिटेक्शन
यह गाइड बताती है कि स्पीच टू टेक्स्ट API के साथ एंटिटी डिटेक्शन कैसे इस्तेमाल करें।
कैसे करें गाइड · मानता है कि आपने स्पीच टू टेक्स्ट क्विकस्टार्ट पूरा कर लिया है।
ओवरव्यू
एंटिटी डिटेक्शन एक फ़ीचर है, जो ट्रांसक्रिप्ट में खास शब्दों और वाक्यांशों का पता लगाता है और उनके सटीक टाइमस्टैम्प देता है। यह क्रेडिट कार्ड नंबर, नाम, मेडिकल कंडीशन या SSN पहचानने के लिए उपयोगी है, जिन्हें बाद में रिडैक्ट किया जा सकता है।
इसे सक्षम करने पर, मॉडल ट्रांसक्रिप्ट में खास एंटिटी टाइप का पता लगाता है और उनके सटीक टाइमस्टैम्प देता है।
उदाहरण के लिए, यह ऑडियो:
जब हम एंटिटी टाइप के रूप में "pii" (व्यक्तिगत रूप से पहचान योग्य जानकारी) बताते हैं, तो यह यह ट्रांसक्रिप्ट आउटपुट करता है:
नतीजे में ट्रांसक्रिप्ट में पहचानी गई PII एंटिटी उनके सटीक टाइमस्टैम्प के साथ दिखती हैं।
एंटिटी डिटेक्शन इंटीग्रेट करना
एंटिटी डिटेक्शन को स्पीच टू टेक्स्ट API में convert मेथड को entity_detection पैरामीटर देकर इंटीग्रेट किया जाता है।
एंटिटी प्रकार
डिटेक्शन के लिए नीचे दिए गए एंटिटी प्रकार समर्थित हैं। आप pii, phi, pci, other, या offensive_language कैटेगरी कीवर्ड का इस्तेमाल करके पूरे समूहों का पता लगा सकते हैं, या उनके लेबल से अलग-अलग एंटिटी प्रकार तय कर सकते हैं। सभी एंटिटी प्रकारों का पता लगाने के लिए all कैटेगरी का इस्तेमाल करें।
PII (व्यक्तिगत रूप से पहचान योग्य जानकारी)
PHI (सुरक्षित स्वास्थ्य जानकारी)
PCI (पेमेंट कार्ड इंडस्ट्री)
अन्य एंटिटीज़
आपत्तिजनक भाषा
एंटिटी रिडैक्शन
एंटिटीज़ का पता लगाने के अलावा, आप entity_redaction पैरामीटर से उन्हें ट्रांसक्रिप्ट टेक्स्ट से हटा भी सकते हैं। यह entity_detection जैसा ही फ़ॉर्मैट स्वीकार करता है: all, कैटेगरी कीवर्ड या खास एंटिटी प्रकारों की सूची। रिडैक्ट किए गए प्रकार, पता लगाए गए प्रकारों के सबसेट होने चाहिए।
रिडैक्शन चालू होने पर, मिले हुए एंटिटी टेक्स्ट को ट्रांसक्रिप्ट टेक्स्ट और वर्ड-लेवल आउटपुट, दोनों में एक मार्कर से बदल दिया जाता है और रिस्पॉन्स में entities फ़ील्ड नहीं लौटाई जाती।
entity_redaction_mode पैरामीटर मार्कर का फ़ॉर्मैट नियंत्रित करता है:
combined मल्टीचैनल आउटपुट स्टाइल के साथ एंटिटी डिटेक्शन और रिडैक्शन समर्थित नहीं हैं।