बोलते ही टेक्स्ट में बदल जाएगी आवाज: Meta ने लॉन्च किया Muse Voice Transcribe, हिंदी समेत 5 भारतीय भाषाओं का है सपोर्ट
Meta के सुपरइंटेलिजेंस लैब्स ने अपना पहला रियल-टाइम ऑडियो मॉडल Muse Voice Transcribe लॉन्च किया है। ग्लोबली 70 से ज्यादा ...और पढ़ें

Meta ने लॉन्च किया Muse Voice Transcribe.
टेक्नोलॉजी डेस्क, नई दिल्ली। Meta ने 'Muse Voice Transcribe' लॉन्च किया है, जो ग्लोबली 70 से ज्यादा भाषाओं के सपोर्ट के साथ हिंदी, तमिल, तेलुगु, कन्नड़ और मलयालम जैसी 5 प्रमुख भारतीय भाषाओं को भी सपोर्ट करता है। ये Meta Superintelligence Labs द्वारा तैयार किया गया पहला रियल-टाइम ऑडियो परसेप्शन मॉडल है। ये एक ही सिस्टम में लाइव स्पीच ट्रांसक्रिप्शन, स्पीकर को अलग-अलग पहचानना और एंडपॉइंटिंग जैसी सुविधाओं को एक साथ लाता है, साथ ही ये कोड-स्विचिंग और 20 से ज्यादा लोगों के बीच होने वाली बातचीत को भी संभालता है।
Meta Muse Voice Transcribe लाया रियल-टाइम ट्रांसक्रिप्शन
कंपनी ने एक ब्लॉग पोस्ट में बताया कि Muse Voice Transcribe पूरी रिकॉर्डिंग खत्म होने का इंतजार करने के बजाय, किसी के बोलते ही उसी वक्त आवाज को टेक्स्ट में बदल सकता है। ये अलग-अलग स्पीकर्स की पहचान कर सकता है और ये भी पकड़ लेता है कि किसी ने बोलना कब शुरू किया और कब बंद किया। ट्रांसक्रिप्शन, स्पीकर्स की पहचान और एंडपॉइंटिंग ऑडियो आते ही लाइव हो जाती है, जिसके लिए बाद में अलग से प्रोसेसिंग करने की जरूरत नहीं पड़ती।
Meta के मुताबिक, ये एक ही रिकॉर्डिंग में 20 से ज्यादा लोगों की आवाज में फर्क पहचान सकता है और एक घंटे से ज्यादा लंबे ऑडियो पर भी काम कर सकता है। इससे ये लंबे समय तक चलने वाली बातचीत को बिना छोटे-छोटे क्लिप्स में बांटे पूरा ट्रांसक्राइब कर लेता है।

ये मॉडल 80-मिलीसेकंड के छोटे-छोटे चंक्स में ऑडियो प्रोसेस करता है और ये तय करता है कि हर शब्द को लिखने के लिए उसके पास काफी जानकारी आ चुकी है या नहीं। जिन शब्दों को पहचानना थोड़ा मुश्किल होता है, उनके लिए यह थोड़ा इंतजार कर सकता है, जबकि आसान शब्दों को तुरंत लिख देता है। Meta का कहना है कि रीइन्फोर्समेंट लर्निंग की मदद से मॉडल ये फैसला खुद लेता है, जिससे गलतियों की गुंजाइश काफी कम रहती है।
Meta ने इस मॉडल को 70 से ज्यादा भाषाओं पर ट्रेन किया है और शुरुआती रिलीज के लिए इनमें से 25 भाषाओं की कड़ी टेस्टिंग की है। कंपनी ने एक प्रेस रिलीज में बताया कि इसमें हिंदी, तमिल, तेलुगु, कन्नड़ और मलयालम जैसी 5 प्रमुख भारतीय भाषाएं शामिल हैं।
इसके अलावा, अगर बातचीत के दौरान लोग भाषा बदलते हैं- यहां तक कि एक ही वाक्य के बीच में भी दूसरी भाषा बोलते हैं- तो भी ये मॉडल उसे आसानी से ट्रांसक्राइब कर लेता है। यूजर्स को हर बार भाषा बदलने पर मैनुअली सेटिंग बदलने की कोई जरूरत नहीं पड़ती। ये मॉडल लैंग्वेज, कीवर्ड और कॉन्टेक्स्ट बायसिंग को सपोर्ट करता है, जिससे बातचीत के संदर्भ को समझकर सटीक शब्द चुनने में मदद मिलती है।
Meta Muse Voice Transcribe की कीमत और उपलब्धता
Meta ने Muse Voice Transcribe को Meta Model API के जरिए उपलब्ध करा दिया है, ताकि डेवलपर्स इसे अपने एप्स में स्पीच ट्रांसक्रिप्शन के लिए इस्तेमाल कर सकें। Mac के लिए Meta AI और Muse Code पहले से ही डिक्टेशन के लिए इसका इस्तेमाल कर रहे हैं। इस API की कीमत प्रति 1,000 ऑडियो मिनट के लिए $3 (लगभग 300 रुपये) रखी गई है, जो प्रति घंटे के हिसाब से करीब $0.18 (लगभग 17 रुपये) बैठती है।
यह भी पढ़ें: क्या है JioPC? जिससे पुराना लैपटॉप हो जाएगा सुपरफास्ट, 16GB तक RAM और 1TB स्टोरेज भी
