PromptRobust (benchmark) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

PromptRobust (এছাড়াও PromptBench নামে পরিচিত) — এটি বৃহৎ ভাষা মডেলগুলির (LLM) অ্যাডভার্সারিয়াল প্রম্পট পরিবর্তনের প্রতি সহনশীলতা মূল্যায়নের জন্য একটি ব্যাপক benchmark — অর্থাৎ কার্যের বিবরণের ছোট বিকৃতি যা তার অর্থ পরিবর্তন করে না[1][2]। benchmark টি ২০২৩ সালে Microsoft Research Asia-র গবেষকদের একটি দল (Kaijie Zhu এবং অন্যান্য) দ্বারা তৈরি করা হয়েছিল[1]। PromptRobust-এর উদ্ভব এই পর্যবেক্ষণ থেকে যে আধুনিক বৃহৎ ভাষা মডেলগুলি (BYM) বিবরণের বিবরণীর বিস্তারিত বিষয়ে সংবেদনশীল: এমনকি তুচ্ছ পরিবর্তনও (যেমন টাইপো বা পুনরায় বাক্যগঠন) মডেলগুলির উত্তরকে লক্ষণীয়ভাবে প্রভাবিত করতে পারে[2]। benchmark টি এই দুর্বলতাকে পরিমাণগতভাবে পরিমাপ করতে এবং BYM-এর সাথে মিথস্ক্রিয়ার আরও নির্ভরযোগ্য পদ্ধতির বিকাশে সহায়তা করার জন্য তৈরি করা হয়েছে।

মূল্যায়ন পদ্ধতি

PromptBench গবেষণার কাঠামোতে ৪৭৮৮টি পরিবর্তিত প্রম্পটের একটি কর্পাস তৈরি করা হয়েছিল যা কার্যগুলির মূল অর্থ বজায় রাখে[3]। এই অ্যাডভার্সারিয়াল প্রম্পটগুলি পরিবর্তনের চারটি জটিলতার স্তরে তৈরি করা হয়েছিল[1]:

  • অক্ষর স্তর: টাইপো প্রবেশ করানো, অক্ষর প্রতিস্থাপন বা স্থানান্তর (এলোমেলো ইনপুট ত্রুটি অনুকরণ করে)।
  • শব্দ স্তর: কিছু শব্দকে প্রতিশব্দ দিয়ে প্রতিস্থাপন, "শব্দ-গোলমাল" বা অন্যান্য তুচ্ছ শব্দভান্ডার পরিবর্তন প্রবেশ করানো।
  • বাক্য স্তর: বাক্যের কাঠামো পুনরায় বাক্যগঠন, সামগ্রিক বিষয় পরিবর্তন না করে বাক্যাংশের অংশ যোগ করা বা স্থানান্তর করা।
  • অর্থগত স্তর: এর কার্য বজায় রেখে প্রশ্নটি গভীরভাবে পুনরায় প্রণয়ন করা (যেমন, একই প্রশ্নের বিকল্প বিবরণী)[1]

এই ধরনের "আক্রমণগুলির" লক্ষ্য হল — তুচ্ছ বিচ্যুতিগুলি (যেমন, এলোমেলো টাইপো বা প্রতিশব্দ বিবরণী ব্যবহার) মডেলের কার্য সঠিকভাবে সম্পাদন করার ক্ষমতাকে কীভাবে প্রভাবিত করে তা পরীক্ষা করা, যখন কার্যটি নিজেই পরিবর্তিত হয়নি[1]। প্রতিটি তৈরি অ্যাডভার্সারিয়াল প্রম্পট স্ট্যান্ডার্ড NLP কার্যগুলির একটি সিরিজে প্রয়োগ করা হয়েছিল, যার মধ্যে রয়েছে অনুভূতি বিশ্লেষণ, ব্যাকরণগত সঠিকতা সনাক্তকরণ, ডুপ্লিকেট বাক্য অনুসন্ধান, যৌক্তিক অনুমান (NLI), পঠন বোধগম্যতা, মেশিন অনুবাদ এবং গণিত সমস্যা সমাধান[1]। পরীক্ষাগুলির জন্য ১৩টি dataset-এ ৮টি বিভিন্ন ধরনের কার্য নির্বাচন করা হয়েছিল — ক্লাসিক GLUE সেট থেকে (যেমন অনুভূতির জন্য SST-2, NLI-র জন্য MNLI) বিশেষায়িত গণিত এবং বহুভাষিক পরীক্ষা পর্যন্ত[1]

গুরুত্বপূর্ণ বিষয় হল, বিভিন্ন প্রম্পট ফরম্যাটের সহনশীলতা পরীক্ষা করা হয়েছিল[1]:

  • উদাহরণ ছাড়া সরাসরি প্রশ্ন (zero-shot, শুধুমাত্র নির্দেশ)।
  • কয়েকটি উদাহরণ সহ প্রশ্ন (few-shot, যখন প্রম্পটে সমাধানের নমুনা দেওয়া হয়)।
  • ভূমিকা প্রম্পট (in-context roles, যেমন, "আপনি একটি অনুভূতি বিশ্লেষণ সিস্টেম, নির্ধারণ করুন...")।
  • কার্য বর্ণনাকারী প্রম্পট (task-oriented, কার্যের সরাসরি বর্ণনা)[1]

বিভিন্ন বড় ভাষা মডেলও পরীক্ষা করা হয়েছিল — তুলনামূলকভাবে ছোট Flan-T5-large এবং UL2 মডেল থেকে উন্নত ChatGPT এবং GPT-4 পর্যন্ত, সেইসাথে LLaMA 2 পরিবারের ওপেন মডেল এবং সেগুলি থেকে উদ্ভূত Vicuna[1]। আক্রমণ তৈরির জন্য অ্যাডভার্সারিয়াল NLP ক্ষেত্রের বিদ্যমান পদ্ধতিগুলি (যেমন TextBugger, DeepWordBug, TextFooler ইত্যাদি) ব্যবহার করা হয়েছিল, যা ইনপুট ডেটার পরিবর্তে প্রম্পট পরিবর্তনের জন্য অভিযোজিত করা হয়েছিল[1]। প্রাপ্ত "বিকৃত" প্রম্পটগুলির সঠিকতা স্বয়ংক্রিয় এবং ম্যানুয়াল পদ্ধতি দ্বারা যাচাই করা হয়েছিল; প্রতিবেদন অনুযায়ী, কমপক্ষে ৮৫% অ্যাডভার্সারিয়াল বৈচিত্র সঠিক অর্থগত অর্থ বজায় রাখে এবং মানুষের কাছে বোধগম্য[1]। সুতরাং, আক্রমণগুলির প্রভাব বিশেষভাবে পুনরায় বাক্যগঠিত কার্য উপলব্ধিতে মডেলের ব্যর্থতা প্রতিফলিত করে, কার্যের অর্থ নিজেই হারানো নয়।

ফলাফল এবং উপসংহার

পরীক্ষাগুলি দেখিয়েছে যে আধুনিক BYM গুলি প্রশ্নের বিবরণীতে ছোট পরিবর্তনের প্রতি অপর্যাপ্তভাবে সহনশীল[3]। সমস্ত পরীক্ষিত মডেলের জন্য তৈরি আক্রমণগুলির প্রভাবে উত্তরের গুণমানে উল্লেখযোগ্য হ্রাস পরিলক্ষিত হয়েছে[3]। বিশেষত, এমনকি সহজ ক্ষেত্রেও — যেমন একটি গণিত সমস্যার পাঠ্যে টাইপো বা একটি মূল শব্দকে তার প্রতিশব্দ দিয়ে প্রতিস্থাপন — মডেলটি ভুল ফলাফল দিয়েছে, যদিও বিকৃতি ছাড়া এটি সঠিকভাবে সম্পন্ন করেছিল[1]। লেখকদের সাধারণ উপসংহার: "আধুনিক বৃহৎ ভাষা মডেলগুলি অ্যাডভার্সারিয়াল প্রম্পটের প্রতি robust (সহনশীল) নয়"[3], অর্থাৎ phrasing-এ তুচ্ছ বিচ্যুতিগুলি পদ্ধতিগতভাবে তাদের বিভ্রান্ত করতে পারে।

বিভিন্ন ধরনের আক্রমণ বিশ্লেষণ করে দেখা গেছে যে BYM-এর কাজে সবচেয়ে বিধ্বংসী প্রভাব ফেলে শব্দ স্তরের পরিবর্তনগুলি[2]। শব্দগুলিকে প্রতিশব্দ দিয়ে প্রতিস্থাপন বা তুচ্ছ শব্দ-গঠনমূলক বিকৃতি একই কার্যগুলিতে মূল ফলাফলের তুলনায় গড়ে ≈৩৩% সবচেয়ে বড় গুণমান হ্রাসের কারণ হয়েছিল[2]অক্ষর স্তরের আক্রমণগুলি (টাইপো, এলোমেলো অক্ষর) গড়ে ~২০% নির্ভুলতা হ্রাস ঘটিয়েছে[2]। প্রম্পটে গুণগত পরিবর্তন বা সম্পূর্ণ বাক্য যোগ করা, বিপরীতভাবে, অনেক দুর্বল প্রভাব ফেলেছে, প্রায় মডেলকে বিচলিত করেনি[1]অর্থগত পুনরায় বাক্যগঠন (অনুরোধের গভীর ভিন্নভাবে পুনর্বর্ণনা) সাধারণ টাইপোর মতো ক্ষতিকর প্রমাণিত হয়েছে[1]। এই তথ্যগুলি জোর দেয় যে BYM গুলি সূক্ষ্ম শব্দগত পরিবর্তন এবং মূল শব্দে ত্রুটির প্রতি বিশেষভাবে দুর্বল[1]। উল্লেখযোগ্যভাবে, ব্যাকরণগত বিকৃতিগুলি (টাইপো) তাত্ত্বিকভাবে স্ট্যান্ডার্ড বানান পরীক্ষার সরঞ্জাম দ্বারা ফিল্টার করা যেতে পারে, যেখানে শব্দ এবং অর্থ স্তরের পরিবর্তনগুলি মডেলের কাছ থেকে উন্নত অর্থগত বোঝাপড়া দাবি করে যা বর্তমান মডেলগুলিতে প্রায়শই অভাব থাকে[1]

বিভিন্ন মডেলের কার্যক্ষমতা বিশ্লেষণ তাদের robustness-এ উল্লেখযোগ্য বিচ্ছুরণ দেখিয়েছে[1]GPT-4 এবং UL2 অ্যাডভার্সারিয়াল প্রম্পটের প্রতি সর্বোত্তম সহনশীলতা প্রদর্শন করেছে[1]। Flan-T5-large মডেল এবং কথোপকথন মডেল ChatGPT-ও কিছুটা কম ব্যর্থতার শিকার হয়েছে[1]। LLaMA 2 পরিবারের মডেলগুলি মধ্যবর্তী অবস্থানে রয়েছে, যেখানে Vicuna (13B) সব ধরনের আক্রমণে সবচেয়ে দুর্বল হিসেবে বিশিষ্ট হয়েছে[1]। আকর্ষণীয়ভাবে, মডেলের আকার robustness-এর নির্ধারক কারণ হয়নি[1]: তুলনামূলকভাবে ছোট T5-large উত্তরের স্থিতিশীলতায় অনেক বড় ChatGPT মডেলের কাছাকাছি ছিল[1]। লেখকরা অনুমান করেন যে মডেলের প্রশিক্ষণ এবং fine-tuning পদ্ধতি মূল ভূমিকা পালন করে, শুধু আকার নয়[1]। সুতরাং, UL2 এবং T5-large বড় ডেটা কর্পাসে বিস্তারিত প্রি-ট্রেনিং পেয়েছিল, এবং ChatGPT মানব প্রতিক্রিয়া থেকে Reinforcement Learning দিয়ে (RLHF) প্রশিক্ষিত হয়েছিল, যা তাদের সহনশীলতাকে শক্তিশালী করতে পারে[1]। বিপরীতভাবে, Vicuna তুলনামূলকভাবে সীমিত dataset-এ (একটি ওপেন রেপ্লিকা হিসেবে) প্রশিক্ষিত হয়েছিল, যা সম্ভবত বিবরণী পরিবর্তনের প্রতি তার উচ্চ সংবেদনশীলতার কারণ[1]। এই ফলাফলগুলি নির্দেশ করে যে fine-tuning পদ্ধতির উন্নতি শুধু আকার বাড়ানোর চেয়ে মডেলের নির্ভরযোগ্যতা বেশি বাড়াতে পারে।

প্রম্পট ফরম্যাটের প্রভাব

অনুরোধ উপস্থাপনের ফর্মও উত্তরের নির্ভরযোগ্যতাকে প্রভাবিত করে[1]। এটি প্রতিষ্ঠিত হয়েছে যে উদাহরণ সহ প্রম্পট (few-shot) উদাহরণ ছাড়া একক-পদক্ষেপ নির্দেশাবলীর (zero-shot) তুলনায় মডেলের সহনশীলতা উল্লেখযোগ্যভাবে বাড়ায়[1]। প্রম্পটে বেশ কয়েকটি প্রদর্শনী কার্যের উদাহরণ থাকা মডেলকে শব্দ-গোলমাল পরিবর্তন থাকলেও কার্যটি আরও সঠিকভাবে ব্যাখ্যা করতে সাহায্য করে। ভূমিকা প্রম্পট এবং বর্ণনামূলক (task-oriented) প্রম্পট সামগ্রিকভাবে সহনশীলতার একটি তুলনামূলক স্তর দেখিয়েছে, যদিও তাদের কার্যকারিতা কার্য থেকে কার্যে পরিবর্তিত হয়েছে[1]। উদাহরণস্বরূপ, অনুভূতি বিশ্লেষণ এবং ডুপ্লিকেট বাক্য ডেটায় ভূমিকা ফরম্যাট কিছুটা বেশি নির্ভরযোগ্য ছিল, যেখানে পঠন বোধগম্যতা এবং অনুবাদের কার্যগুলিতে স্পষ্ট কার্য নির্দেশাবলী ভালোভাবে কাজ করেছে[1]। এই পর্যবেক্ষণগুলি প্রম্পট ডিজাইনে নির্দেশিকা হিসেবে কাজ করতে পারে: বিস্তারিত উদাহরণ এবং ভূমিকার প্রসঙ্গ যোগ করা অ-মানক বিবরণীতে মডেলের ত্রুটির সম্ভাবনা কমায়।

মডেলগুলির মধ্যে আক্রমণের স্থানান্তরযোগ্যতা

মডেলগুলির মধ্যে আক্রমণের স্থানান্তরযোগ্যতা (ট্রান্সফার) সীমিত প্রমাণিত হয়েছে[1]। একটি মডেলের বিরুদ্ধে বিশেষভাবে নির্বাচিত অ্যাডভার্সারিয়াল প্রম্পটগুলি সর্বদা অন্য মডেলের বিরুদ্ধে সমানভাবে কার্যকর নয়[1]। সুতরাং, এটি উল্লেখ করা হয়েছিল যে ChatGPT-এর দুর্বলতার জন্য তৈরি "ফাঁদ" প্রম্পটগুলি GPT-4-এ অনেক কম প্রভাব ফেলে[1]। পরেরটি সম্ভবত ভালোভাবে পরিচালনা করেছিল কারণ আক্রমণগুলি সরাসরি তার আর্কিটেকচারে স্থানান্তরিত হয়নি — যা একটি মডেলকে বিভ্রান্ত করে তা ভিন্ন প্রশিক্ষণ সহ আরও উন্নত মডেলে কাজ নাও করতে পারে[1]। তবুও, কিছু ধরনের সহজ বিকৃতি (যেমন, টাইপো) একসাথে বেশ কয়েকটি মডেলে নেতিবাচক প্রভাব ফেলেছিল, যা তাদের ভাষিক ভিত্তিতে একই ধরনের দুর্বল স্থানগুলির ইঙ্গিত দেয়।

ব্যবহারিক সুপারিশ

PromptBench কাজের সময় BYM ব্যবহারকারী এবং ডেভেলপারদের জন্য ব্যবহারিক সুপারিশগুলিও চিহ্নিত করা হয়েছিল[2]। সহজ উপসংহার: বিবরণীর স্থিতিশীলতা গুরুত্বপূর্ণ[2]প্রশ্নে টাইপো এবং অযত্নশীল বিবরণী এড়ানো প্রয়োজন[2]। লেখকরা দেখিয়েছেন যে এমনকি ছোট ত্রুটি সংশোধন করা (বানান, এলোমেলো বড় হাতের অক্ষর, অতিরিক্ত স্থান) মডেলের উত্তরের নির্ভরযোগ্যতা উল্লেখযোগ্যভাবে বাড়াতে পারে[2]। এছাড়াও, নির্দেশের শব্দ নির্বাচন তার সহনশীলতাকে প্রভাবিত করে[2]। সহনশীল বনাম দুর্বল প্রম্পটে পদ বারংবারতা বিশ্লেষণে দেখা গেছে যে কিছু শব্দ "নির্ভরযোগ্য" প্রম্পটে বেশি দেখা যায়, অন্যগুলি — যেখানে মডেল বিভ্রান্ত হয়েছে[2]। উদাহরণস্বরূপ, "acting", "provided", "detection" ইত্যাদি শব্দযুক্ত প্রম্পটগুলি কম ঘন ঘন ব্যর্থতার কারণ হয়েছিল, যেখানে "respond", "following" বা "examine" এর মতো শব্দগুলি আরও সমস্যাযুক্ত ক্ষেত্রে দেখা গেছে[2]। এটি নির্দেশ করে যে প্রশ্নগুলির নির্দিষ্ট শৈলী এবং শব্দভান্ডার মডেলের দুর্বলতাগুলি প্রশমিত বা বিপরীতভাবে উস্কে দিতে পারে। সাধারণভাবে বলা হয় প্রশ্নটি যতটা সম্ভব স্পষ্ট, অস্পষ্টতামুক্ত এবং মডেলের জন্য পরিচিত পদে প্রণয়ন করতে, বিশেষত গুরুত্বপূর্ণ অ্যাপ্লিকেশনের জন্য[2]

গবেষকদের দ্বারা উল্লেখিত একটি আকর্ষণীয় পার্শ্ব প্রতিক্রিয়া হল প্রশ্নে অর্থহীন বা অপ্রাসঙ্গিক পাঠ্যের অংশ যোগ করার প্রভাব[2]। দেখা গেছে যে প্রম্পটের শেষে বা মাঝখানে এলোমেলো অক্ষর সিকোয়েন্স (যেমন, "LKF0FZxMZ4") সন্নিবেশ করা মডেলের মনোযোগকে বিভ্রান্ত করতে পারে এবং তার উত্তরের নির্ভুলতা হ্রাস করতে পারে[2]। অন্যদিকে, একটি নিরপেক্ষ কিন্তু ব্যাকরণিকভাবে সঠিক বাক্যাংশ যোগ করা (যেমন "and true is true") কিছু ক্ষেত্রে বিপরীতভাবে উত্তর উন্নত করেছে, যেন মডেলকে প্রশ্নের গুরুত্বপূর্ণ অংশগুলিতে মনোনিবেশ করাচ্ছে[2]। এই ঘটনা জোর দেয় যে BYM গুলি ইনপুটের আপাতদৃষ্টিতে তুচ্ছ বিবরণে কতটা অপ্রত্যাশিতভাবে প্রতিক্রিয়া করে। এটি মডেলগুলির অভ্যন্তরীণ কাঠামোর জটিলতার প্রমাণও: প্রসঙ্গের ক্ষুদ্রতম পরিবর্তন হয় তাদের কাজ ব্যাহত করতে পারে বা উন্নত করতে পারে, এটি নির্ভর করে কীভাবে মডেলের মনোযোগ পুনর্বণ্টিত হয় তার উপর।

গুরুত্ব এবং আরও বিকাশ

PromptRobust/PromptBench BYM-এর নির্ভরযোগ্যতা বোঝার ক্ষেত্রে উল্লেখযোগ্য অবদান রেখেছে[2]। প্রস্তাবিত benchmark এবং সংগৃহীত ডেটা সম্প্রদায়ের জন্য উন্মুক্ত: কোড এবং অ্যাডভার্সারিয়াল প্রম্পটের সেটগুলি রিপোজিটরিতে পাওয়া যায়[1]। এটি অন্যান্য গবেষকদের প্রশ্নের বৈচিত্র্যের প্রতি সহনশীলতার জন্য নতুন মডেল পরীক্ষা করতে এবং ফলাফল তুলনা করতে দেয়[1]। পরবর্তী পদক্ষেপ হল এই ধরনের আক্রমণ থেকে মডেলগুলিকে রক্ষা করার পদ্ধতির বিকাশ — উদাহরণস্বরূপ, সম্ভাব্য টাইপো এবং পুনরায় বাক্যগঠন বিবেচনা করে উন্নত প্রশিক্ষণ অ্যালগরিদম, বা ইনপুট বক্তৃতার অন্তর্নির্মিত নরমালাইজেশন সিস্টেম[2]। PromptBench ইতিমধ্যে বাস্তব অসঠিক ইনপুট ডেটার প্রতি ভাষা মডেলগুলির robustness বৃদ্ধির এই ধরনের গবেষণার ভিত্তি হিসেবে বিবেচনা করা হচ্ছে[2]

পরিশেষে, Zhu এবং সহকর্মীদের কাজ ব্যবহারিক অ্যাপ্লিকেশনে BYM বাস্তবায়নের সময় প্রম্পটের সহনশীলতার বিবেচনার গুরুত্ব প্রদর্শন করে: মডেলগুলিকে কেবল "পরিষ্কার" ডেটায় উচ্চ নির্ভুলতা দেখালেই হবে না, বরং ইনপুটে তুচ্ছ বিচ্যুতিতেও সঠিকতা বজায় রাখতে হবে, তা ব্যবহারকারীর এলোমেলো ত্রুটি হোক বা উদ্দেশ্যমূলক আক্রমণাত্মক প্রভাব হোক[2][4]

সূত্র

  • PromptBench মূল প্রবন্ধ (arXiv)
  • GitHub-এ PromptBench রিপোজিটরি
  • প্রবন্ধ "Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

সাহিত্য

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

টীকা

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». arXiv. [১]
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 «Prompt Robustness: How to Measure and How to Enhance». Towards AI. [২]
  3. 3.0 3.1 3.2 3.3 «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». arXiv. [৩]
  4. «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». Language Technologies Institute - School of Computer Science - Carnegie Mellon University. [৪]