लेख पर जाएँ
आदमियों की आवाज़

वीडियो रिकॉर्डिंग कैसे ट्रांसक्रिप्ट करें

वीडियो रिकॉर्डिंग को कैसे बनाएं इसके लिए आवरण उदाहरण

एक चित्रात्मक पाठ में वीडियो रिकॉर्ड किया जाता है. आप इसे डोcs में चिपका सकते हैं, ब्लॉग पोस्टों के लिए फिर से तैयार कर सकते हैं, या सिर्फ 20 रि-मा पर नज़र रखने के बजाय इसे रीफ्रेक्टिंग के.

यह गाइड वीडियो रिकॉर्डिंग को चालू करने के मुख्य तरीके बताता है - AI सेवा के लिए मुक्त बनाया गया उपकरण जो मिनटों में लंबी रिकॉर्डिंग संचालित करता है और अपने काम के प्रवाह के लिए सही एक लेने के लिए कैसे।

विडियो रेकॉर्ड क्यों लिखें

कुछ कारण जो आप लिख सकते हैं:

  • शीर्षक और सबटाइटल. अधिकांश दृश्य शिक्षण शिक्षण तथा ध्वनि बन्द करने वाले डेमो हैं. एक जाँच सही शीर्षकों के लिए प्रारंभ बिन्दु है.
  • ढूंढने योग्य अभिलेख. एक अखबार के मुताबिक, एक लेख में बताया गया है कि आप हर सभा, शिक्षण पाठ या कोर्स के दौरान क्या वीडियो बना सकते हैं।
  • मन की शांति। एक दर्ज किए गए ब्लॉग पोस्ट में एक दर्ज किए गए सैर को चालू करें, पृष्ठ Doc, या आधार के आधार पर.
  • पाठ द्वारा संपादन. कुछ संपादक आपको शब्दों को एक स्वर से मिटाने देता है और उसी तरह वीडियो में स्वचालित कटौती होती है.
  • पहुँच और पालन. अनेक पहुँच के स्तरों के लिए ट्रांसमिट की ज़रूरत होती है और उन जगहों तक पहुँचने के लिए जहाँ दृश्य स्रोत भाषा नहीं बोलते।

पिछले दो वर्षों में उपयोग करने योग्य प्रतिलेखन के लिए पट्टी में तेजी से वृद्धि हुई है। AI मॉडल एक घंटे की शुद्ध ऑडियो एक मिनट से भी कम में ऊपर की सटीकता के साथ ट्रांसक्रिप्ट 95% मुफ्त, अंतर्निहित उपकरण पकड़ रहे हैं लेकिन अभी भी समर्पित सेवाओं में देरी है।

विधि 1: अस्क्रिप्ट दर्ज कीजिए

मुक्त विकल्प रिकॉर्ड करने के लिए है कि आप क्या सुनते हैं और टाइप करें. एक सरल भाषा के साथ खाली क्लिप के लिए यह लगभग पांच मिनट लेता है. 30 मिनट के लिए यह तीन घंटे ले सकते हैं.

केवल तभी इसके लायक है जब:

  • रिकार्डिंग एक मिनट या दो के अंदर है
  • आपको कानूनी या लेख - विषय के लिए बहुत ही सही शब्दों की ज़रूरत है
  • ऑडियो शोर है या भारी उच्चारण है कि AI मॉडल संघर्ष है

किसी भी लंबे समय या दोहराव के लिए, एक AI उपकरण पर कूद.

विधि 2 macOS एक कार्यवाही के रूप में अंतर्निहित डिक्टेशन

macOS में लाइव डिटेक्शन है लेकिन कोई अंतर्निहित सुविधा नहीं है जो सहेजे गए वीडियो फ़ाइल को सीधे ट्रांसक्रिप्ट करती है। सामान्य कार्यवाही रिकॉर्डिंग को जोर से खेलने और इसके साथ डिटेक्ट करना है, जो नाजुक और धीमा है।

macOS पर एक विस्तृत मुक्त विकल्प आवाज ज्ञापन सिस्टम ऑडियो रूटिंग के साथ संयुक्त ऐप - वॉयस मेमो में वीडियो के ऑडियो को रिकॉर्ड करें, और हालिया macOS संस्करण ऐप में एक ट्रांसक्रिप्ट दिखाएंगे।

सीमा: यह वास्तविक रूप से अ-प्रयोग नहीं है. विशेषता है कि आप शब्द-स्तरन्स नहीं पा सकते, और आप मूल वीडियो सिंक खो देते हैं. इसका प्रयोग सिर्फ अंतिम-शिक्षित विकल्प के रूप में करें.

विधि 3: AI सेवा के साथ पढ़ने का तरीका

समर्पित AI प्रतिलेखन सेवाएं कुछ मिनट से अधिक समय तक रिकॉर्डिंग के लिए मानक उत्तर हैं। मुख्य विकल्पः

  • ElevenLabs लेखिका - वर्तमान में अंग्रेजी और 90+ अन्य भाषाओं के लिए सबसे सटीक मॉडल में से एक। वर्ड-लेवल टाइमस्टैम्प, स्पीकर डायरीकरण, और ऑडियो घटना का पता लगाना। ऑडियो के लगभग $0.40 per घंटे के आसपास भुगतान-जैसा-आप-जाओ मूल्य निर्धारण।
  • OpenAI चुप्पी - ओपन सोर्स मॉडल जो आधुनिक सटीकता पट्टी सेट करता है. यदि आप इसे स्थानीय रूप से चलाते हैं, या के माध्यम से मुक्त. OpenAI s API पर $0.006 अंग्रेजी में मजबूत, अधिकांश प्रमुख भाषाओं में सभ्य।
  • सम्मेलन - डेवलपर केंद्रित API स्पीकर लेबल, भावना, और विषय का पता लगाने के साथ. कीमतों $0.37 per घंटे के आसपास शुरू होता है.
  • Otter. ai - ब्राउज़र और मोबाइल ए.
  • प्रका - AI प्रतिलेखन और मानव-सत्यापित प्रतिलेखन दोनों प्रदान करता है। मानव द्वारा अधिक सटीकता, उच्च लागत ($1.50+ प्रति मिनट)।
  • Descript - विकसित-इन-ग्नमेंट के साथ वीडियो संपादक. आप इसके साथ उच्चारण तथा वीडियो संपादन संपादित करें.

कार्य के प्रवाह के लिए एक ही प्रकार की रिकॉर्डिंग है: फ़ाइल अपलोड करें, इंतजार करें, इस रूप में डाउनलोड डाउनलोड करें .txt, .srt, या .vtt.

चरण 1 - ऑडियो निर्यात करें या वीडियो अपलोड करें

अधिकांश सेवाएं आम वीडियो प्रारूपों (MP4, MOV) को सीधे स्वीकार करती हैं। यदि आपका नहीं है, तो एक त्वरित FFmpeg कमांड के साथ ऑडियो निकालेंः

ffmpeg -i recording.mp4 -vn -acodec mp3 recording.mp3

कदम 2 - अपलोड तथा चुन- आउट विकल्प

स्रोत भाषा चुनें, क्या समय चिह्नों को पता करना है, और क्या आप समय चिह्नों को चाहते हैं. शब्द-स्तर चिह्न उपयोगी हैं यदि आप शीर्षक बनाने या फिर चेक किए जाने की योजना बना सकते हैं.

चरण 3 - परिणाम डाउनलोड करें

ज़्यादातर सेवाओं के लिए सादा पाठ तथा एक समय से पहले का फ़ॉर्मेट (SRT या VTT) ही सीमित है. यदि आपको केवल एक लिखित सारांश की आवश्यकता होती है, तो सादा पाठ काफी है.

स्टैंड-अलोन सेवाओं का नीचे दौर है. आप एक ही उपकरण में एक, ट्रॉइनिंग, एक तिहाई में संपादन. प्रत्येक हाथ बंद एक जगह है जहाँ समय-समय बहाव या फ़ॉर्मेटिंग ब्रेक हो.

विधि 4: स्क्रीन लेखक द्वारा बनाया गया लिखित उच्चारण के साथ स्क्रीन का प्रयोग

यह एक ऐसा यंत्र है जो एक ही ऐप के अंदर की रिकॉर्डिंग को बनाता है, इसलिए यह लेख वीडियो टाइमलाइन से जुड़ा रहता है।

Tight Studio

Tight Studio स्क्रीन रिकॉर्डिंग को कैप्शन में ट्रांसक्रिप्ट करना

Tight Studio है Mac स्क्रीन रिकॉर्डर और अंतर्निहित प्रतिलेखन के साथ वीडियो संपादक द्वारा संचालित ElevenLabs यहाँ प्रवाह हैः

  1. अपना स्क्रीन रेकॉर्ड करें एक युक्ति के बिना या बिना. बहु-जोजोरज आप की जाँच की जरूरत है अगर उसे अलग से रिकार्ड करने देता है.
  2. शीर्षकों को खोलें संपादक तथा क्लिक करें शीर्षक बनाएँ. ऑडियो अपलोड कम्पेशन सेवा में किया जा रहा है तथा शब्द- लेवल्स के साथ लौटाता है.
  3. भविष्यवाणियों की समीक्षा करें खण्ड के खण्ड. शब्द वीडियो समय पर जुड़े हुए हैं, तो एक शब्द पर क्लिक करता है जो कि संकेतक को बार बार बार जाता है.
  4. पाठ इनलाइन संपादित करें किसी भी सिस्टेप वाले शब्द (प्रोसेममम, तकनीकी शब्दावली) को ठीक करने के लिए.
  5. शैली तथा शीर्षकों में बर्न करें यदि आप उन्हें निर्यात किए वीडियो में चाहते हैं, या सिर्फ अपने डोम्स के लिए सिंपल का उपयोग करें.
  6. निर्यात अनुवाद किए गए शीर्षकों के आखिरी वीडियो, या पाठ के रूप में उच्चारण की नकल करें.

क्योंकि जाँच संपादक के अंदर रहती है, आप इसे भी इस्तेमाल कर सकते हैं:

  • ट्रामम्ड शब्द स्वचालित से
  • उत्पन्न करें AI उसी स्क्रिप्ट से आवाजें अगर आप अपनी लाइव वॉइसओवर को बदलने का निर्णय लेते हैं
  • शब्द को सीधे- सीधे संपादित करने के द्वारा फिर से प्रसंग

Tight Studio ट्रांसक्रिप्शन के लिए ElevenLabs स्क्रिप्ट का उपयोग करता है, जो 90+ भाषाओं का समर्थन करता है और शब्द स्तर के समय टिकट का उत्पादन करता है। वीडियो निर्यात करने से पहले ट्रांसक्रिप्ट कैप्शन पैनल के अंदर संपादित किया जा सकता है।

Descript

Descript अन्य प्रसिद्ध एकीकृत विकल्प है। आप वीडियो रिकॉर्ड या आयात करते हैं, ऐप एक प्रतिलिपि उत्पन्न करता है, और आप पाठ को संपादित करके वीडियो को संपादित कर सकते हैं। पॉडकास्ट शैली की सामग्री और लंबे रूप के वीडियो के लिए मजबूत। स्क्रीन रिकॉर्डर से कम और अधिक पूर्ण वीडियो वर्कस्टेशन।

विधि 5: स्थानीय रूप से अप्रचलित करने के लिए गनचक चलाएँ

यदि आप बहुत सारे वीडियो रिकॉर्ड करते हैं और प्रति मिनट भुगतान नहीं करना चाहते हैं, तो चल रहा है OpenAI स्विपर मॉडल स्थानीय रूप से तकनीकी उपयोगकर्ताओं के लिए एक अच्छा विकल्प है।

brew install ffmpeg
pipx install openai-whisper
whisper recording.mp4 --model medium --output_format srt

वह medium आधुनिक मैज पर मॉडल रिवेंस गति और सटीकता. large-v3 मॉडल धीमा है लेकिन अधिक यथार्थ है, विशेष रूप से गैर-िश भाषा के लिए.

व्यापार बन्द:

  • एक- समय सेटअप के बाद मुक्त
  • क्लाउड सेवाओं की तुलना में धीमा (सबसे बड़े मॉडल के लिए 5-10x)
  • किसी सामान्य आधुनिक Mac (M1 या नया अनुशंसित) की जरूरत है
  • कोई स्पीकर म्यूजेशन नहीं है बॉक्स से बाहर - आप जैसे दूसरे उपकरण पर बंद करना होगा whisperx

यह सबसे अच्छा विकल्प है यदि आप हर महीने दर्जन घंटे कर रहे हैं और शून्य प्रति "अंकरी लागत चाहते हैं.

वीडियो उच्चारण विधियों की तुलना

विधिगतिशुद्धता मानसबसे अच्छा के लिएलागत
हस्तचालित टाइपिंगबहुत धीमायदि सावधानी बरतती है तो सर्वोच्चक्लिप्स, कानूनी परिशुद्धतामुफ़्त
macOS डिक्टेशन वर्कआउटधीमाकमएक बंद लो क्लिप्समुफ़्त
AI सेवा (ElevenLabs, Whisper API, AssemblyAI)तेजउच्च (95%+ साफ ऑडियो पर)अधिकांश रिकॉर्डिंग$0.006-$0.40 per मिनट
अंतर्निर्मित अनुक्रम (Tight Studio)तेजउच्च (आतंश ElevenLabs)स्क्रीन रिकॉर्डिंग एक ए ऐप में अंत-से- सम्पन्न किया गयासदस्यता सहित जोड़ें
स्थानीय षॉइडमध्यमज्यादाउच्च- सिर्फ आत्म- होस्ट उपयोगसेटअप के बाद मुक्त
मानव- अपरीक्षित (v)धीमासर्वोच्चकानूनी, जन भाषण, आज्ञा माननाप्रति मिनट $1.50+

सही विडियो वर्णन के लिए युक्तियाँ

ऑडियो रेकॉर्ड करें. एक शांत कमरे में एक दिशा - सूचक किसी भी AI मॉडल चाल को हराता है।

यदि आपका उपकरण समर्थित है तो एक ग्लॉसी जोड़ें. ElevenLabs स्क्रिप्ट जैसी सेवाएँ keyterm प्रम्प्ट्स स्वीकार करती हैं - उत्पाद नामों या तकनीकी शब्दों की एक छोटी सूची जो मॉडल को दिशा में बदल देती है। यह उत्पाद डेमो और ट्यूटोरियल के लिए सबसे बड़ा सटीकता सुधार है।

सही भाषा चुनें. ज़्यादातर सेवाओं से भाषा स्वचालित पता चल जाए परंतु स्वचालित रूप से छोटे क्लिप पर असफल हो सकते हैं. स्रोत भाषा को साफ- साफ नियत करें यदि आप यह जानते हैं.

लंबी रिकॉर्डिंग अलग करें. कई घंटे के रिकॉर्डिंग के लिए, 20-30 minute टुकड़ों में विभाजित आपको तेजी से टर्नअराउंड देता है और आपको ट्रांसक्रिप्ट को संपादित करना शुरू करने देता है जबकि बाकी अभी भी प्रसंस्करण में है।

उचित संज्ञाओं और संख्या की समीक्षा करें. AI ट्रांसक्रिप्शन लगातार सही संज्ञाओं, संस्करण संख्याओं और संक्षिप्त नामों को भंग करता है। ट्रांसक्रिप्ट को स्किम करें और इन्हें हाथ से ठीक करें - यह अंतिम कैप्शन में उन्हें स्लिप करने से तेज़ है।

अक्सर पूछे जाने वाले सवाल

मैं वीडियो रिकॉर्ड कैसे बनाता हूं?

वीडियो को AI स्क्रिप्शन सेवा जैसे ElevenLabs स्क्रिप्ट, OpenAI व्हिस्पर या AssemblyAI पर अपलोड करें। सेवा एक घंटे के वीडियो के लिए समय टिकट के साथ एक स्क्रिप्ट लौटा देती है, आमतौर पर एक मिनट से कम समय में। यदि आप Mac पर रिकॉर्ड कर रहे हैं, तो Tight Studio जैसे स्क्रीन रिकॉर्डर में एक अंतर्निहित सुविधा के रूप में स्क्रिप्शन शामिल है ताकि आप एक ही ऐप में ट्रांसक्रिप्ट और संपादन कर सकें।

सबसे सही विडियो अनुवाद औज़ार क्या है?

शुद्ध स्वचालित प्रतिलेखन के लिए, ElevenLabs स्क्रिप्ट और OpenAI व्हिस्पर (बड़े-v3) वर्तमान में शुद्ध अंग्रेजी ऑडियो पर 95-97% के आसपास सटीकता बेंचमार्क पर अग्रणी हैं। अधिकतम सटीकता के लिए, Rev जैसी मानव-सत्यापित सेवाएं लगभग सही प्रतिलेखन का उत्पादन करती हैं लेकिन काफी अधिक लागत पर।

मैं मुक्त के लिए एक वीडियो स्केल कर सकते हैं?

हाँ. दो मुख्य मुफ्त विकल्प OpenAI Whisper को स्थानीय रूप से अपने कंप्यूटर पर चलाते हैं, और Otter. ai जैसी सेवाओं के मुफ्त स्तरों का उपयोग करते हैं (प्रति माह कुछ सौ मिनट तक सीमित)। मैनुअल प्रतिलेखन भी मुफ्त है लेकिन केवल बहुत छोटी क्लिप के लिए व्यावहारिक है।

यह वीडियो के एक घंटे को कितना लेता है?

क्लाउड AI सेवाएं आमतौर पर एक घंटे के लिए ऑडियो के लिए 1-5 minutes में एक प्रतिलिपि वापस करती हैं। हालिया Mac पर स्थानीय चुस्का एक घंटे के लिए 5-15 minutes लेता है, मॉडल के आकार के आधार पर। मैनुअल प्रतिलिपि आमतौर पर प्रति घंटे ऑडियो के लिए 4-6 hours लेता है।

एक लेख और शीर्षकों में क्या फर्क है?

एक ट्रांसक्रिप्ट बोलने वाले ऑडियो का सादा पाठ संस्करण है, जो सामग्री को पढ़ने या फिर से उपयोग करने के लिए उपयोगी है। कैप्शन वीडियो पर ओवरले किए गए समयबद्ध पाठ हैं, जो देखने के दौरान उपयोग किए जाते हैं। अधिकांश ट्रांसक्रिप्शन उपकरण दोनों का उत्पादन कर सकते हैं - समयबद्ध प्रारूप (SRT या VTT) कैप्शन है, सादा पाठ संस्करण ट्रांसक्रिप्ट है।

वीडियो संपादक के अंदर एक चेक संपादित कर सकते हैं?

हां, संपादकों में जो इसे समर्थन करते हैं। Tight Studio और Descript दोनों आपको वीडियो टाइमलाइन के साथ लाइन में ट्रांसक्रिप्ट संपादित करने देते हैं। शब्द अपने टाइमस्टैम्प से जुड़े रहते हैं, इसलिए सुधार कैप्शन समय को नहीं तोड़ते हैं। स्टैंडअलोन ट्रांसक्रिप्शन टूल आमतौर पर एक पाठ फ़ाइल उत्पन्न करते हैं जिसे आप अलग से संपादित करते हैं।

क्या विडियो अनुवाद की छपाई दूसरी भाषाओं में होती है?

हां. अधिकांश आधुनिक प्रतिलेखन सेवाएं 50+ भाषाओं का समर्थन करती हैं। ElevenLabs स्क्रिप्ट और OpenAI व्हिस्पर दोनों 90+ भाषाओं का समर्थन करते हैं। अंग्रेजी और अन्य व्यापक रूप से बोली जाने वाली भाषाओं के लिए सटीकता सबसे अधिक है, और कम प्रशिक्षण डेटा वाले भाषाओं के लिए कुछ हद तक गिर जाती है।

एक्स पर शेयर