অধ্যায় 2 · লার্জ ল্যাঙ্গুয়েজ মডেলের ভেতরে
লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) কী?
- পৃষ্ঠা 3 / 8
- 2 মিনিট পড়া
লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) হলো বিপুল পরিমাণ লেখা দিয়ে ট্রেনিং দেওয়া একটা ডিপ লার্নিং মডেল, যার কাজ শুনতে খুব সহজ: কিছু লেখা দেওয়া হলে, এরপর কী আসবে তা অনুমান করা।
বিশাল আকারের অটোকমপ্লিট
ফোনের কিবোর্ড পরের শব্দ সাজেস্ট করে। LLM-ও একই কাজ করে — তবে সে ইন্টারনেটের বিশাল লেখা, বই আর কোড থেকে শিখেছে, আর খুঁজে পাওয়া প্যাটার্নগুলো — ব্যাকরণ, তথ্য, যুক্তির ধরন, কোডের গঠন — রাখার জন্য তার আছে শত শত কোটি প্যারামিটার।
যখন জিজ্ঞেস করেন "বাংলাদেশের রাজধানী কোনটি?", মডেল কোথাও খুঁজে দেখে না। ট্রেনিং অনুযায়ী যে উত্তরটা সবচেয়ে সম্ভাব্য, লেখাটা সেভাবে এগিয়ে নেয়: ঢাকা। বেশিরভাগ সময় সবচেয়ে সম্ভাব্য উত্তরটাই সঠিক — এজন্যই LLM এত কাজের; আবার এজন্যই মাঝে মাঝে আত্মবিশ্বাসের সাথে ভুল বলে (অধ্যায় ৩)।
"লার্জ" মানে কী
- বড় ডেটা — লক্ষ কোটি টোকেনের লেখা।
- বড় মডেল — শত শত কোটি প্যারামিটার।
- বড় কম্পিউটিং — হাজার হাজার বিশেষ চিপে ট্রেনিং।
কাঠামো: ট্রান্সফর্মার
প্রায় সব আধুনিক LLM ট্রান্সফর্মার-এর ওপর বানানো, যা এসেছে ২০১৭ সালের গবেষণাপত্র Attention Is All You Need থেকে। এর মূল ধারণা অ্যাটেনশন: একটা শব্দ বোঝার সময় মডেল দেখে লেখার অন্য প্রতিটা শব্দ তার জন্য কতটা প্রাসঙ্গিক। "The bank of the river was muddy" বাক্যে অ্যাটেনশনের কারণে "bank" শব্দটা "river" থেকে অর্থ নেয় — তাই মডেল বোঝে এটা নদীর তীর, টাকার ব্যাংক নয়।
পরিচিত কিছু LLM
ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google), Llama (Meta) সহ আরও অনেক — সবই LLM, শুধু ভিন্নভাবে ট্রেনিং ও টিউন করা। এই টিউটোরিয়ালের ধারণাগুলো সবার ক্ষেত্রেই খাটে।
মূল কথা
- LLM বারবার লেখার পরের অংশটা অনুমান করে।
- সে সবচেয়ে সম্ভাব্য অংশটা দেয় — যা সাধারণত, কিন্তু সবসময় নয়, সঠিক।
- ট্রান্সফর্মার আর তার অ্যাটেনশন পদ্ধতিই আধুনিক LLM-কে কার্যকর করেছে।