অধ্যায় 2 · লার্জ ল্যাঙ্গুয়েজ মডেলের ভেতরে
প্রম্পট থেকে উত্তর
- পৃষ্ঠা 5 / 8
- 2 মিনিট পড়া
আপনি প্রশ্ন লেখেন, আর উত্তর শব্দে শব্দে ভেসে আসে। মাঝখানে কী ঘটে — আর একটা সাধারণ লেখা-অনুমানকারী কীভাবে কাজের সহকারী হয়ে উঠল — চলুন দেখি।
অ্যাসিস্ট্যান্ট কীভাবে তৈরি হয়
- প্রি-ট্রেনিং — বিপুল লেখায় মডেল পরের টোকেন অনুমান করতে শেখে। ফলাফল অনেক কিছু জানে, কিন্তু আচরণ করে লেখা পূরণকারীর মতো, সহকারীর মতো নয়।
- ইন্সট্রাকশন টিউনিং — নির্দেশ আর ভালো উত্তরের উদাহরণ দিয়ে আরও ট্রেনিং দিলে সে অনুরোধ মেনে চলতে শেখে।
- মানুষের মতামত থেকে শেখা — মানুষ (আর অন্য মডেল) একাধিক উত্তর তুলনা করে; যে উত্তরগুলো সহায়ক, সৎ ও নিরাপদ বলে বিবেচিত, মডেলকে সেদিকে টিউন করা হয়। এই ধাপটাকে প্রায়ই RLHF বলা হয়।
উত্তর তৈরি, এক টোকেন করে
ইনফারেন্সের সময় মডেল একটা লুপ চালায়। নিচের স্কেচে ধারণাটা দেখানো হলো (এটা বোঝানোর জন্য, আসল কোনো লাইব্রেরি নয়):
tokens = tokenize(conversation) # আপনার প্রম্পট, টোকেন আইডি হিসেবে
while True:
probabilities = model(tokens) # সম্ভাব্য প্রতিটা পরের টোকেনের সম্ভাবনা
next_token = sample(probabilities, temperature=0.7)
if next_token == END_OF_TURN:
break
tokens.append(next_token) # এ পর্যন্ত লেখা উত্তরও ইনপুট হয়ে যায়
show(detokenize([next_token])) # এজন্যই উত্তর শব্দে শব্দে আসে
প্রতিটা নতুন টোকেন বাছা হয় আগের সবকিছু দেখে — আপনার প্রম্পট এবং মডেল এর মধ্যে যা লিখে ফেলেছে। এজন্যই শুরুর দিকের একটা ভুল পুরো উত্তর জুড়ে থেকে যেতে পারে।
টেম্পারেচার: স্থির নাকি সৃজনশীল
মডেল প্রতিটা সম্ভাব্য টোকেনকে একটা সম্ভাবনা দেয়। টেম্পারেচার ঠিক করে সে কীভাবে বাছবে:
- কম (০-এর কাছে) — প্রায় সবসময় সবচেয়ে সম্ভাব্য টোকেন। বেশি অনুমানযোগ্য, বারবার একই রকম; তথ্য বের করা, শ্রেণিবিন্যাস, কোডের জন্য ভালো।
- বেশি — কম সম্ভাব্য টোকেনও বেশি বাছা হয়। বেশি বৈচিত্র্য; আইডিয়া খোঁজা আর সৃজনশীল লেখার জন্য ভালো।
কম টেম্পারেচার উত্তরকে ধারাবাহিক করে, সঠিক করে না — মডেল ধারাবাহিকভাবে ভুলও বলতে পারে।
মূল কথা
- প্রি-ট্রেনিং দেয় জ্ঞান; ইন্সট্রাকশন টিউনিং আর মানুষের মতামত বানায় সহকারী।
- উত্তর তৈরি হয় টোকেন ধরে ধরে, প্রতিটা নির্ভর করে আগের পুরো লেখার ওপর।
- টেম্পারেচার অনুমানযোগ্যতা আর বৈচিত্র্যের মধ্যে ভারসাম্য করে — নির্ভুলতা নিয়ন্ত্রণ করে না।