Least-to-most Prompting (BN)
Least-to-Most Prompting (LtM) — বৃহৎ ভাষা মডেলের (LLM) জন্য প্রম্পট তৈরির একটি পদ্ধতি, যা জটিল সমস্যাগুলিকে সহজতর ধাপে বিভাজন করে এবং তারপর ধারাবাহিকভাবে সেই উপ-সমস্যাগুলি সমাধান করে[1]। এই পদ্ধতিটি ২০২২ সালে Google Brain-এর একটি গবেষক দল Denny Zhou-এর নেতৃত্বে প্রস্তাব করেছিল এবং ICLR 2023 সম্মেলনে উপস্থাপন করা হয়েছিল[2]। পদ্ধতির মূল লক্ষ্য হলো Chain-of-Thought প্রম্পটের সীমাবদ্ধতা অতিক্রম করা, যা প্রম্পট-ভিত্তিক শিক্ষায় মডেলকে দেখানো উদাহরণগুলির চেয়ে জটিল সমস্যায় ভালো কাজ করে না[2]। Least-to-Most Prompting মডেলকে অধিক জটিল সমস্যায় সাধারণীকরণ করতে সক্ষম করে, একইসাথে এটি ব্যাখ্যাযোগ্য থাকে এবং নিউরাল নেটওয়ার্কের অতিরিক্ত প্রশিক্ষণের প্রয়োজন হয় না[2]। পদ্ধতির নামটি শিক্ষামূলক মনোবিজ্ঞান থেকে নেওয়া হয়েছে, যেখানে «least to most prompting» বলতে একজন শিক্ষার্থীকে নতুন দক্ষতা আয়ত্ত করতে সাহায্যের জন্য ক্রমবর্ধমান মাত্রায় সহায়তার একটি সিরিজ প্রম্পট প্রদান করাকে বোঝায়[3]।
পদ্ধতির বিবরণ
Least-to-Most Prompting পদ্ধতি দুটি ধাপে বাস্তবায়িত হয়[2], যার প্রতিটি ধাপ ভাষা মডেলকেই carefully-crafted prompts-এর মাধ্যমে নির্দেশ দেওয়া হয় (মডেলের অতিরিক্ত fine-tuning ছাড়াই):
- সমস্যার বিভাজন। প্রথম ধাপে মডেল নির্দেশনা এবং উদাহরণ পায়, যা দেখায় কীভাবে একটি জটিল সমস্যাকে সহজতর উপ-সমস্যার ধারাবাহিকতায় বিভক্ত করতে হয়। তারপর মডেলকে একটি নির্দিষ্ট জটিল প্রশ্ন দেওয়া হয় এবং সে সরলীকৃত মধ্যবর্তী প্রশ্নের তালিকা তৈরি করে[2]। উদাহরণস্বরূপ, একটি জটিল সমস্যার জন্য মডেল নিজেই মূল সমস্যার একটি অংশ সম্বোধন করে একটি স্পষ্টকারী উপ-প্রশ্ন তৈরি করতে পারে।
- উপ-সমস্যার ধারাবাহিক সমাধান। দ্বিতীয় ধাপে মডেল প্রাপ্ত উপ-সমস্যাগুলি একে একে সমাধান করে — সবচেয়ে সহজ থেকে সবচেয়ে জটিল পর্যন্ত। এর জন্য প্রতিটি উপ-সমস্যার আগে প্রসঙ্গ থাকে: অনুরূপ উপ-সমস্যার সমাধানের উদাহরণ, এবং (যদি থাকে) ইতোমধ্যে সমাধান করা পূর্ববর্তী উপ-সমস্যাগুলি তাদের উত্তরসহ[4]। প্রথম উপ-সমস্যা সমাধান করে মডেল তার উত্তর প্রম্পটের পাঠ্যে যোগ করে এবং পরবর্তী উপ-সমস্যা পায়, পূর্ববর্তী সমাধানগুলি প্রসঙ্গ হিসেবে ব্যবহার করে[4]। এভাবে চলতে থাকে যতক্ষণ না চূড়ান্ত, সবচেয়ে জটিল উপ-সমস্যাটি সমাধান হয়, যা সরাসরি মূল প্রশ্নের উত্তর দেয়।
উদাহরণ: মূল পাঠ্য সমস্যাটি Least-to-Most পদ্ধতির মাধ্যমে দুটি ধাপে বিভক্ত করা হয়। প্রথমে মডেল একটি মধ্যবর্তী প্রশ্ন তৈরি ও সমাধান করে («How long does each trip take?» — «প্রতিটি যাত্রায় কত সময় লাগে?»), উত্তর পায় «each trip takes 5 minutes» («প্রতিটি যাত্রায় ৫ মিনিট লাগে»)। এই উত্তরটি পরবর্তী উপ-সমস্যাসহ নতুন প্রম্পটে অন্তর্ভুক্ত হয় — মূল প্রশ্ন («How many times can she slide before it closes?» — «এটি বন্ধ হওয়ার আগে সে কতবার নামতে পারবে?»)। পূর্ববর্তী ফলাফল ব্যবহার করে মডেল চূড়ান্ত উত্তর গণনা করে (এই উদাহরণে: ৩ বার)।
মূলত, Least-to-Most Prompting স্ট্যান্ডার্ড chain-of-thought পদ্ধতি থেকে আলাদা কারণ এটি যুক্তি প্রক্রিয়াটিকে জ্ঞান সঞ্চয়ের সাথে পৃথক অনুরোধে বিভক্ত করে, একটি উত্তরের মধ্যে একটানা «চিন্তার শৃঙ্খল» তৈরির পরিবর্তে[3]। এই ধাপে ধাপে, পুনরাবৃত্তিমূলক পদ্ধতি মডেলকে ধীরে ধীরে সমস্যার আরও জটিল দিকগুলিতে অগ্রসর হতে দেয়, কার্যকরভাবে easy-to-hard generalization সমস্যা দূর করে (যখন মডেল প্রশিক্ষণ উদাহরণগুলির চেয়ে কঠিন সমস্যার মুখোমুখি হয়)[2][3]। উল্লেখ্য, LtM পদ্ধতির উভয় ধাপই few-shot prompting (কয়েকটি উদাহরণ প্রদর্শন)-এর মাধ্যমে বাস্তবায়িত হয় এবং মডেলের অতিরিক্ত প্রশিক্ষণ বা নতুন ডেটায় fine-tuning প্রয়োজন হয় না[2]। এছাড়াও, পদ্ধতিটি LLM-এর যুক্তি উন্নত করার অন্যান্য কৌশলের সাথে সামঞ্জস্যপূর্ণ, উদাহরণস্বরূপ, উত্তর তৈরিতে chain-of-thought এবং self-consistency (একাধিক সমাধানের ক্রমানুযায়ী নমুনা)-এর সাথে একত্রিত করা যায়, যদিও এটি আবশ্যক নয়[1]।
পরীক্ষামূলক ফলাফল ও প্রয়োগ
Least-to-Most Prompting প্রস্তাবকারী গবেষণায় দেখানো হয়েছে যে এই পদ্ধতিটি বহু-ধাপের জটিল যুক্তি প্রয়োজন এমন বেশ কিছু সমস্যায় স্ট্যান্ডার্ড প্রম্পটিং পদ্ধতিকে ছাড়িয়ে যায় (chain-of-thought সহ)[1]। এটি তিনটি মূল সমস্যার বিভাগে তার সুবিধা সফলভাবে প্রদর্শন করেছে:
- প্রতীকী ও অ্যালগরিদমিক সমস্যা। উদাহরণস্বরূপ, শব্দের শেষ অক্ষর যোড়া লাগানো (তালিকার প্রতিটি শব্দের শেষ অক্ষর ক্রমানুসারে নিয়ে নতুন শব্দ তৈরি করা) সমস্যায় LtM পদ্ধতি দীর্ঘতর শব্দ ক্রমে মডেলের সাধারণীকরণ ক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করেছে। বিশেষ প্রশিক্ষণ ছাড়া GPT-3 (code-davinci-002) মডেল chain-of-thought প্রম্পটে এই সমস্যাগুলি সঠিকভাবে মাত্র প্রায় ৩২% ক্ষেত্রে সমাধান করতে পারত যখন শব্দের তালিকার দৈর্ঘ্য ১২ হত, আর Least-to-Most Prompting ব্যবহারে নির্ভুলতা ~৭৪% পর্যন্ত পৌঁছেছিল[1]। ছোট তালিকায় (উদাহরণে ব্যবহৃত দৈর্ঘ্য) উভয় কৌশলই ভালো কাজ করত, কিন্তু ক্রমের দৈর্ঘ্য বাড়ার সাথে সাথে chain-of-thought-এর মান দ্রুত হ্রাস পেত, যেখানে Least-to-Most আরও মসৃণ হ্রাস নিশ্চিত করত এবং উচ্চ নির্ভুলতা বজায় রাখত[1]। এটি LtM পদ্ধতির সমাধানের যুক্তি সাধারণীকরণ করার ক্ষমতা প্রদর্শন করে আরও জটিল (দীর্ঘ) ইনপুটের জন্য।
- কম্পোজিশনাল সাধারণীকরণ (compositional generalization)। এই বিভাগের সমস্যায় অন্তর্ভুক্ত রয়েছে, উদাহরণস্বরূপ, পাঠ্য নির্দেশনাকে কর্মের ক্রমে অনুবাদ করা (যেমন SCAN benchmark-এ, যেখানে «jump twice and run» ধরনের আদেশ পালন করতে এবং দীর্ঘতর সমন্বয়ে সাধারণীকরণ করতে হয়)[4]। LtM পদ্ধতি LLM-কে এই ধরনের সমস্যার সবচেয়ে জটিল রূপান্তরগুলিও সফলভাবে সমাধান করতে সক্ষম করেছে। বিশেষভাবে, LtM প্রম্পটে GPT-3 মডেল SCAN dataset-এর সমস্ত ডেটা বিভাজন রূপান্তরে (সবচেয়ে কঠিন length split সহ, যেখানে পরীক্ষার ক্রম প্রশিক্ষণের চেয়ে দীর্ঘ) ৯৯% নির্ভুলতা অর্জন করেছে, প্রম্পটে মাত্র ১৪টি উদাহরণ ব্যবহার করে[2]। তুলনামূলকভাবে, অনুরূপ পরিস্থিতিতে স্ট্যান্ডার্ড chain-of-thought পদ্ধতি মাত্র প্রায় ১৬% নির্ভুলতা দিয়েছিল[2]। আরও উল্লেখযোগ্য, এটি মডেলকে প্রশিক্ষণ ডেটায় শেখানো ছাড়াই অর্জিত হয়েছে, যেখানে SCAN-এর পূর্ববর্তী সেরা সমাধানগুলি বিশেষ নিউরো-সিম্বলিক আর্কিটেকচার বা ডেটা সম্প্রসারণ পদ্ধতির উপর নির্ভর করত যাতে >১৫,০০০ উদাহরণের সম্পূর্ণ প্রশিক্ষণ সেট ব্যবহার করতে হত[2][2]। এভাবে, Least-to-Most Prompting fine-tuning ছাড়া মডেলের জন্য অভূতপূর্ব কম্পোজিশনাল সাধারণীকরণ ক্ষমতা প্রদর্শন করেছে।
- গাণিতিক পাঠ্য সমস্যা। পদ্ধতিটি পাঠ্যে অঙ্কের সমস্যায় পরীক্ষা করা হয়েছে, উদাহরণস্বরূপ, GSM8K dataset থেকে (যোগ/বিয়োগ ও যুক্তির জটিল পাঠ্য সমস্যা)[2], এবং DROP সেটের কিছু প্রশ্নে (পাঠ্যে সংখ্যাগত তথ্য বের করা ও গণনা করার দক্ষতা পরীক্ষা করে)[2]। এখানেও Least-to-Most Prompting chain-of-thought-এর তুলনায় নির্ভুলতা উন্নত করেছে। GSM8K-তে code-davinci-002 মডেল ব্যবহারে উত্তরের নির্ভুলতা ~৬০.৯% থেকে ~৬২.৪%-এ বৃদ্ধি পেয়েছে[2]। DROP-এর উপ-কাজে লাভ আরও উল্লেখযোগ্য ছিল: উদাহরণস্বরূপ, «ফুটবল» সংক্রান্ত প্রশ্নের একটি অংশে নির্ভুলতা ~৫৯.৬% (chain-of-thought) থেকে LtM প্রয়োগে ~৭৩.৪%-এ উন্নীত হয়েছে[2]। যদিও গাণিতিক সমস্যায় মানের বৃদ্ধি SCAN-এর মতো নাটকীয় ছিল না, লেখকরা একটি গুরুত্বপূর্ণ বিষয় উল্লেখ করেছেন: মডেল সঠিক সমস্যার বিভাজন পেলে প্রায় যেকোনো GSM8K সমস্যা সঠিকভাবে সমাধান করা যায়[2]। এটি ইঙ্গিত করে যে সফল সমাধানের চাবিকাঠি হলো সুগঠিত মধ্যবর্তী প্রশ্ন; LtM পদ্ধতি ঠিক এই প্রশ্নগুলির স্বয়ংক্রিয় তৈরি ও তাদের ধারাবাহিক সমাধানের দিকে লক্ষ্য রাখে।
সামগ্রিকভাবে, পরীক্ষাগুলি নিশ্চিত করে যে Least-to-Most Prompting বহু-ধাপের অনুমান প্রয়োজন এমন অনেক ধরনের সমস্যায় যুক্তিহীন নিষ্পাপ few-shot প্রম্পটিং এবং chain-of-thought পদ্ধতি উভয়কেই উল্লেখযোগ্যভাবে ছাড়িয়ে যায়[1]। পদ্ধতিটি LLM-কে উদাহরণের মাধ্যমে মডেল প্রাথমিকভাবে যে সমস্যার সাথে পরিচিত হয়েছিল তার চেয়ে জটিল সমস্যা সমাধান করতে সক্ষম করে, in-context learning (প্রম্পটের মাধ্যমে তাৎক্ষণিক শিক্ষা)-এর সীমানা প্রসারিত করে।
সীমাবদ্ধতা ও ভবিষ্যৎ দিকনির্দেশনা
সাফল্য সত্ত্বেও, Least-to-Most Prompting পদ্ধতির বেশ কিছু সীমাবদ্ধতা রয়েছে। সর্বপ্রথম, বিভিন্ন ধরনের সমস্যার জন্য বিভাজনে ভিন্ন পদ্ধতি প্রয়োজন। গাণিতিক সমস্যা কার্যকরভাবে বিভক্ত করার প্রম্পট টেমপ্লেট যৌক্তিক বা সাধারণ জ্ঞানের সমস্যার জন্য একেবারে অনুপযুক্ত হতে পারে[2]। উদাহরণস্বরূপ, যে প্রম্পটগুলি মডেলকে গণিতের পাঠ্য সমস্যা ধাপে ধাপে বিভক্ত করতে শিখিয়েছে সেগুলি «অ্যারিস্টটল কি ল্যাপটপ ব্যবহার করতেন?» ধরনের সাধারণ জ্ঞানের প্রশ্নের জন্য অকেজো প্রমাণিত হয়েছে — এই ধরনের সমস্যার জন্য সম্পূর্ণ ভিন্ন বিভাজন কৌশল প্রয়োজন[2]। তাই প্রতিটি নতুন ডোমেন বা সমস্যার ধরনের জন্য সমস্যাকে উপ-সমস্যায় বিভক্ত করার উদাহরণ নতুনভাবে নির্বাচন করতে হয় এবং সমাধানের কাঠামো চিত্রিত করে একটি সংশ্লিষ্ট prompt তৈরি করতে হয়[3]। অন্য কথায়, কীভাবে সঠিকভাবে সমস্যা বিভক্ত করতে হয় সে জ্ঞান LLM নিজে সর্বজনীনভাবে সাধারণীকরণ করতে পারে না, এটি নির্দিষ্ট সমস্যার শ্রেণির জন্য উদাহরণের মাধ্যমে নির্ধারণ করতে হয়।
আরও, LtM-এর কার্যকারিতা উল্লেখযোগ্যভাবে নির্ভর করে সমস্যাটি স্বাধীন উপ-লক্ষ্যে কতটা সফলভাবে বিভক্ত হয় তার উপর। মডেল যদি মধ্যবর্তী ধাপগুলি সঠিকভাবে তৈরি করতে না পারে বা কিছু প্রয়োজনীয় উপ-সমস্যা বাদ পড়ে, তাহলে চূড়ান্ত সমাধানও ভুল হবে। তবুও, ডেভেলপাররা নিজেরাই উল্লেখ করেছেন যে অনেক ক্ষেত্রে মানুষ যদি সঠিক বিভাজন ম্যানুয়ালি নির্দেশ করে তাহলে ব্যর্থতাকে সাফল্যে রূপান্তরিত করা যায় — তখন মডেল অনায়াসে প্রতিটি অংশ সমাধান করে সফলভাবে উত্তরগুলি একত্রিত করে[2]। এটি পদ্ধতির আরও উন্নয়নের সম্ভাবনা তুলে ধরে: উপ-সমস্যার স্বয়ংক্রিয় তৈরির মান উন্নয়ন এবং সম্ভবত মডেলের ইন্টারেক্টিভ শিক্ষা। LtM লেখকরা উপসংহারে অনুমান করেছেন যে প্রম্পটিং পদ্ধতির ভবিষ্যৎ মডেলের সাথে সম্পূর্ণ দ্বিমুখী সংলাপের দিকে নির্দেশিত হতে পারে, যেখানে মডেল তাৎক্ষণিক প্রতিক্রিয়া এবং তার মধ্যবর্তী ধাপগুলির সংশোধন পায়[2]। Least-to-Most Prompting পদ্ধতিকে এই দিকে একটি পদক্ষেপ হিসেবে বিবেচনা করা যায়, যা দেখায় যে বিভাজন ও ধাপে ধাপে সমাধানের মাধ্যমে মডেলের সাথে ধারাবাহিক মিথস্ক্রিয়া নতুন ডেটায় প্রশিক্ষণ ছাড়াই তার চিন্তা করার ক্ষমতা উল্লেখযোগ্যভাবে প্রসারিত করে[1]।
তথ্যসূত্র
- arXiv-এ মূল নিবন্ধ «Least-to-Most Prompting Enables Complex Reasoning in Large Language Models»
- মূল নিবন্ধের HTML সংস্করণ
- Least-to-Most Prompting কী? — AI Safety Info-এর নিবন্ধ
- Medium-এ পদ্ধতির পর্যালোচনা
- arXiv-এ prompt engineering পদ্ধতির সামগ্রিক পর্যালোচনা
সাহিত্য
- Zhou, D. et al. (2022). Least-to-Most Prompting Enables Complex Reasoning in Large Language Models. arXiv:2205.10625.
- Zhou, D. et al. (2023). Least-to-Most Prompting Enables Complex Reasoning in Large Language Models. ICLR 2023. OpenReview.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
- Kojima, T. et al. (2022). Large Language Models Are Zero-Shot Reasoners. arXiv:2205.11916.
- Nye, M. et al. (2021). Show Your Work: Scratchpads for Intermediate Computation with Language Models. arXiv:2112.00114.
- Lake, B. M.; Baroni, M. (2018). Generalization without Systematicity: On the Compositional Skills of Sequence-to-Sequence Recurrent Networks. arXiv:1711.00350.
- Cobbe, K. et al. (2021). Training Verifiers to Solve Math Word Problems. arXiv:2110.14168.
- Dua, D. et al. (2019). DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs. arXiv:1903.00161.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Zhou, Denny et al. «Least-to-Most Prompting Enables Complex Reasoning in Large Language Models». ar5iv.org. [১]
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 Zhou, Denny et al. «Least-to-Most Prompting Enables Complex Reasoning in Large Language Models». arXiv. [২]
- ↑ 3.0 3.1 3.2 3.3 «What is least-to-most prompting?». AI Safety Info. [৩]
- ↑ 4.0 4.1 4.2 OXEN AI. «Arxiv Dives Toolformer: Language models can teach themselves to use tools». Medium. [৪]