हमें उम्मीद है कि ChatGPT को उपयोगकर्ताओं के लिए उपलब्ध कराने से हमें उन विषयों पर बहुमूल्य जानकारी प्राप्त करने में मदद मिलेगी जिन्हें हमने अभी तक पहचाना नहीं है। हम जानते हैं कि lucky star इसमें अभी भी कई कमियां हैं (इसीलिए हम कुछ पहलुओं को बेहतर बनाने के लिए अपने मॉडलों को नियमित रूप से अपडेट करने के लिए प्रतिबद्ध हैं), जैसा कि पहले बताया गया है। ChatGPT का वर्तमान शोध-चरण संस्करण OpenAI में हमारे द्वारा अपनाई जाने वाली पुनरावर्ती तैनाती प्रक्रिया का नवीनतम चरण है, जिसका उद्देश्य अधिक सुरक्षित AI सिस्टम प्रदान करना है। फिर हम इस संवाद डेटासेट को InstructGPT डेटासेट के साथ मिलाकर इसे संवादात्मक प्रारूप में परिवर्तित करते हैं।
पक्ष – विपक्ष
हम ChatGPT को लॉन्च करने और उपयोगकर्ताओं से प्रतिक्रिया प्राप्त करने के लिए उत्सुक हैं—ताकि अंततः इसकी खूबियों और सुधार के क्षेत्रों का पता चल सके। हमने ChatGPT विकसित किया है, जो एक ऐसा मॉडल है जो उपयोगकर्ताओं के साथ इस तरह से बातचीत करता है जैसे कि उनसे आमने-सामने बातचीत हो रही हो। WilmerHale का शोध कार्य समाप्त हो चुका है, और Altman और Brockman OpenAI का नेतृत्व करने के लिए वापस आ गए हैं। हमने ChatGPT को GPT-3.5 श्रृंखला के एक मॉडल से अनुकूलित किया है, जिसे 2022 की शुरुआत में प्रशिक्षित किया गया था।
- कोच मॉडल द्वारा प्रस्तावित सुझावों का उपयोग करके उत्तर तैयार करने में सहायता प्राप्त कर सकते हैं।
- हम जानते हैं कि अभी भी कई सीमाएँ मौजूद हैं – इसलिए हमने ऊपर उल्लिखित पहलुओं में सुधार करने के लिए अपने मॉडलों को नियमित रूप से अपडेट करने का निर्णय लिया है।
- हमने GPT-3.5 सीरीज मॉडल से ChatGPT को ऑप्टिमाइज़ किया, जिसका प्रशिक्षण 2022 की शुरुआत में पूरा हो गया था।
- ChatGPT अनुसंधान चरण का वर्तमान संस्करण, OpenAI में हमारे द्वारा अधिक सुरक्षित AI सिस्टम प्रदान करने के लिए की जाने वाली पुनरावृत्ति तैनाती प्रक्रिया का नवीनतम चरण है।
लकी स्टार कैसीनो की निष्पक्षता और सुरक्षा

हम संभावित हानिकारक वास्तविक परिणामों (गैर-दुर्भावनापूर्ण परिस्थितियों में) को समझने और ऐसी प्रतिक्रिया प्राप्त करने में विशेष रूप से रुचि रखते हैं जो हमें नए जोखिमों को समझने और संभावित निवारण रणनीतियों की पहचान करने में मदद करेगी। उदाहरण के लिए, मानव प्रतिक्रिया सुदृढ़ीकरण शिक्षण (HFRL) के कार्यान्वयन के बाद त्रुटिपूर्ण और अवांछित परिणामों में उल्लेखनीय कमी आई है। GPT-3 और Codex जैसे पिछले मॉडलों के उपयोग ने इस रिलीज़ में लागू किए गए सुरक्षा उपायों को बेहतर बनाने में महत्वपूर्ण भूमिका निभाई है।
- इन रिवार्ड मॉडलों के आधार पर, हम प्रॉक्सिमेट पॉलिसी ऑप्टिमाइजेशन का उपयोग करके मॉडल को परिष्कृत कर सकते हैं।
- आपको 3.5 सीरीज के बारे में अधिक जानकारी यहां मिलेगी (एक नई विंडो में खुलेगा)।
- विल्मरहेल का शोध समाप्त हुआ और ऑल्टमैन और ब्रॉकमैन ओपनएआई का नेतृत्व करने के लिए वापस लौटे।
- उदाहरण के लिए, मानव प्रतिक्रिया सुदृढ़ीकरण शिक्षण (एचएफआरएल) के उपयोग के बाद त्रुटिपूर्ण और अवांछनीय परिणामों में काफी कमी आई है।
सुरक्षा और निष्पक्षता
यहां आपको 3.5 सीरीज के बारे में अधिक जानकारी मिलेगी (एक नई विंडो में खुलेगा)।
हमने मॉडल को प्रशिक्षित करने के लिए मानव प्रतिक्रिया सुदृढ़ीकरण अधिगम (HFRL) का उपयोग किया, जिसमें हमने InstructGPT के समान विधियों का प्रयोग किया, हालांकि डेटा संग्रह को थोड़ा अलग तरीके से कॉन्फ़िगर किया। हमने उपयोगकर्ताओं को उपयोगकर्ता इंटरफ़ेस के माध्यम से मॉडल द्वारा उत्पन्न समस्याग्रस्त परिणामों के साथ-साथ इंटरफ़ेस के ही एक भाग, बाहरी सामग्री फ़िल्टर से प्राप्त गलत सकारात्मक या नकारात्मक परिणामों की रिपोर्ट करने के लिए प्रोत्साहित किया। इसके लिए (AI प्रशिक्षकों द्वारा चैटबॉट के साथ की गई बातचीत का उपयोग करके मॉडल द्वारा तैयार किए गए संदेशों में से यादृच्छिक रूप से एक संदेश का चयन किया गया), हमने कई वैकल्पिक नमूने निकाले और AI प्रशिक्षकों से उन्हें रैंक करने के लिए कहा। सुदृढ़ीकरण अधिगम के लिए एक पुरस्कार मॉडल बनाने के लिए (हमें तुलनात्मक डेटा एकत्र करने की आवश्यकता थी), हमने गुणवत्ता के आधार पर रैंक किए गए दो या अधिक मॉडल प्रतिक्रियाएँ प्रदान कीं। प्रशिक्षक प्रतिक्रियाएँ तैयार करने में सहायता के लिए मॉडल के सुझावों का संदर्भ ले सकते थे। पिछले मॉडलों ने हमें इस मॉडल को बेहतर बनाने में मदद की – और हम इस संस्करण से सीखे गए सबक का उपयोग करके अधिक शक्तिशाली प्रणालियाँ विकसित करने की आशा करते हैं।