Phi (Microsoft) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Phi — এটি Microsoft Research দ্বারা তৈরি Small Language Models (SLM)-এর একটি পরিবার। এই মডেলগুলি AI উন্নয়নে একটি প্যারাডাইম শিফট উপস্থাপন করে এবং প্রমাণ করে যে কম্প্যাক্ট ও কম্পিউটেশনালি দক্ষ মডেলগুলি অনেক বড় সিস্টেমের সমতুল্য পারফরম্যান্স অর্জন করতে পারে। প্যারামিটার সংখ্যা স্কেল করার উপর ভিত্তি করে প্রচলিত পদ্ধতির বিপরীতে, Phi-এর দর্শন প্রশিক্ষণ ডেটার গুণমান এবং উদ্ভাবনী প্রশিক্ষণ পদ্ধতির উপর দৃষ্টি নিবদ্ধ করে[1]

Phi মডেলগুলি গভীর যুক্তি-তর্কের প্রয়োজন এমন কাজের জন্য অপ্টিমাইজ করা হয়েছে, যেমন প্রোগ্রামিং, গণিত এবং টেক্সট বিশ্লেষণ। তাদের ছোট আকারের কারণে, এগুলি স্থানীয় ডিভাইসে (on-device AI) স্থাপনার জন্য আদর্শ, যার মধ্যে স্মার্টফোন এবং ল্যাপটপ অন্তর্ভুক্ত, যা AI গণতান্ত্রিকীকরণের নতুন সম্ভাবনা উন্মুক্ত করে[2]

দর্শন: «শিক্ষাপুস্তকই আপনার সব প্রয়োজন»

Phi প্রকল্পের মূল অনুকল্প হলো যে একটি উচ্চ-কার্যক্ষম মডেল প্রশিক্ষণের জন্য ডেটার পরিমাণের চেয়ে তার গুণমান বেশি গুরুত্বপূর্ণ। এই ধারণাটি প্রথম «Textbooks Are All You Need» গবেষণাপত্রে প্রণীত হয়েছিল[3]। অফিল্টার করা ওয়েব থেকে ট্রিলিয়ন token-এ প্রশিক্ষণের পরিবর্তে, Phi মডেলগুলি সযত্নে বাছাই করা এবং সিন্থেটিকভাবে তৈরি dataset-এ প্রশিক্ষিত হয়, যা গুণমানের দিক থেকে একটি শিক্ষাপুস্তকের অনুরূপ।

এই পদ্ধতির মূল নীতিগুলি:

  • «শিক্ষাপুস্তকের মানের» ডেটা: প্রশিক্ষণ কর্পাস পরিষ্কার, যুক্তিসংগত এবং ব্যাখ্যামূলক উপকরণ দিয়ে গঠিত, যা শিশুদের বই থেকে অনুপ্রাণিত।
  • সিন্থেটিক ডেটা: ডেটার একটি উল্লেখযোগ্য অংশ বড় মডেলের সাহায্যে তৈরি করা হয় (যেমন GPT-4)। উদাহরণস্বরূপ, Phi-4 প্রশিক্ষণের জন্য ৫০টিরও বেশি কাস্টম পাইপলাইনের মাধ্যমে ৪০০ বিলিয়ন token উচ্চমানের সিন্থেটিক কন্টেন্ট তৈরি করা হয়েছিল[4][5]
  • পুনরাবৃত্তিমূলক প্রশিক্ষণ: ডেটা তৈরি এবং মডেল প্রশিক্ষণের প্রক্রিয়া পুনরাবৃত্তিমূলকভাবে সংঘটিত হয়, যা ডেটা এবং মডেল উভয়ের গুণমান ক্রমাগত উন্নত করতে দেয়।

এই পদ্ধতি Phi মডেলগুলিকে কেবল পরিসংখ্যানগত pattern মুখস্থ না করে গভীর যুক্তি-তর্কের ক্ষমতা বিকাশ করতে সক্ষম করে।

Phi মডেলগুলির বিবর্তন

  • Phi-1 (১.৩ বিলিয়ন প্যারামিটার): জুন ২০২৩ সালে উপস্থাপিত প্রথম মডেলটি Python প্রোগ্রামিংয়ের উপর দৃষ্টি নিবদ্ধ ছিল। এটি HumanEval এবং MBPP benchmark-এ উচ্চতর পারফরম্যান্স প্রদর্শন করে, গুণমানসম্পন্ন ডেটা-ভিত্তিক পদ্ধতির কার্যকারিতা প্রমাণ করে[6]
  • Phi-2 (২.৭ বিলিয়ন প্যারামিটার): ডিসেম্বর ২০২৩ সালে প্রকাশিত, Phi-2 সাধারণ ভাষা বোঝার ক্ষমতায় তার পরিসর বিস্তার করেছে, একটি কম্প্যাক্ট আর্কিটেকচার বজায় রেখে। এই মডেলটি দেখিয়েছে যে SLM-গুলি তাদের চেয়ে কয়েক দশগুণ বড় মডেলের সমতুল্য পারফরম্যান্স অর্জন করতে পারে[7]
  • Phi-3 (৩.৮ - ১৪ বিলিয়ন প্যারামিটার): এপ্রিল ২০২৪ সালে উপস্থাপিত পরিবারটি মোবাইল AI-এর ক্ষেত্রে একটি অগ্রগতি হয়ে ওঠে। Phi-3-mini (৩.৮ বিলিয়ন) স্মার্টফোনে কাজ করতে সক্ষম, Mixtral 8x7B এবং GPT-3.5-এর সমতুল্য পারফরম্যান্স অর্জন করে[8]। পরিবারটিতে Phi-3-small (৭ বিলিয়ন) এবং Phi-3-medium (১৪ বিলিয়ন) সংস্করণও অন্তর্ভুক্ত রয়েছে।
  • Phi-3.5 (৩.৮ - ৬.৬ বিলিয়ন সক্রিয় প্যারামিটার): ২০২৪ সালে ঘোষিত, এই পরিবারে তিনটি মূল মডেল রয়েছে:
    • Phi-3.5-mini-instruct: উন্নত বহুভাষিক সমর্থন সহ অপ্টিমাইজড সংস্করণ।
    • Phi-3.5-MoE-instruct: ১৬ জন বিশেষজ্ঞ এবং ৬.৬ বিলিয়ন সক্রিয় প্যারামিটার সহ Mixture-of-Experts আর্কিটেকচার-ভিত্তিক মডেল।
    • Phi-3.5-Vision-instruct: টেক্সট এবং ছবি প্রক্রিয়াকরণের জন্য মাল্টিমোডাল মডেল[9]
  • Phi-4 (১৪ বিলিয়ন প্যারামিটার): জটিল গাণিতিক যুক্তি-তর্কে বিশেষজ্ঞ মডেল। এটি উল্লেখযোগ্যভাবে ছোট আকারে Gemini-1.5-Flash এবং GPT-4o-mini-এর সমতুল্য পারফরম্যান্স প্রদর্শন করে। Phi-4-reasoning DeepSeek-R1-Distill-Llama-70B-কে ছাড়িয়ে যায়[10]
  • Phi-4-Multimodal (৫.৬ বিলিয়ন প্যারামিটার): পরিবারের প্রথম সম্পূর্ণ মাল্টিমোডাল মডেল, যা একযোগে টেক্সট, ছবি এবং অডিও প্রক্রিয়া করতে সক্ষম। এটি পারস্পরিক হস্তক্ষেপ ছাড়াই বিভিন্ন মোডালিটি দক্ষতার সাথে প্রক্রিয়া করার জন্য উদ্ভাবনী Mixture-of-LoRAs পদ্ধতি ব্যবহার করে[11]

আর্কিটেকচার এবং প্রযুক্তিগত বৈশিষ্ট্য

  • আর্কিটেকচার: Phi মডেলগুলি মূল অপ্টিমাইজেশন সহ decoder-only ধরনের একটি স্ট্যান্ডার্ড transformer আর্কিটেকচার ব্যবহার করে, যেমন দক্ষতা বৃদ্ধির জন্য Grouped Query Attention এবং Flash Attention[12]
  • স্থানীয় স্থাপনা: মডেলগুলি সীমিত সম্পদ সহ ডিভাইসে কাজ করার জন্য অপ্টিমাইজ করা হয়েছে। উদাহরণস্বরূপ, Phi-3-mini ৪-বিট quantization-এ মাত্র ১.৮ জিবি মেমরি প্রয়োজন করে এবং iPhone 14-এ কাজ করতে পারে[13]
  • Framework সমর্থন: Phi মডেলগুলি Microsoft Azure AI Model Catalog, Hugging Face, Ollama এবং NVIDIA NIM microservices-এর মাধ্যমে পাওয়া যায়, যা ডেভেলপারদের জন্য তাদের ব্যাপক ইন্টিগ্রেশন এবং অ্যাক্সেসযোগ্যতা নিশ্চিত করে[14]

পারফরম্যান্স এবং benchmark

মূল benchmark-এ Phi মডেলগুলির তুলনামূলক পারফরম্যান্স
মডেল প্যারামিটার MMLU MT-Bench HumanEval
Phi-3-mini 3.8B 69% 8.38 -
Phi-3-small 7B 75% 8.7 -
Phi-3-medium 14B 78% 8.9 -
Phi-4 14B - - GPT-4-কে ছাড়িয়ে যায়

Phi-4 গাণিতিক সমস্যায় অসাধারণ ফলাফল প্রদর্শন করে, যার মধ্যে American Mathematics Competitions (AMC) অন্তর্ভুক্ত, Gemini-1.5-Flash-এর সমতুল্য পারফরম্যান্স দেখায়[15]। মাল্টিমোডাল Phi-3.5-Vision একই আকারের প্রতিযোগীদের ছাড়িয়ে যায়, BLINK benchmark-এ ৫৭.০% অর্জন করে[16]

বিশেষায়িত প্রয়োগ

Phi মডেলগুলি বিশেষায়িত ক্ষেত্রে উচ্চ কার্যকারিতা প্রদর্শন করে:

  • চিকিৎসা: গবেষণা দেখায় যে চিকিৎসা ও ক্রীড়া পাঠ্যে Phi-3-এর উত্তরগুলি বিশেষজ্ঞ মূল্যায়নের সাথে মাঝারি সম্পর্ক রাখে[17]
  • ঘৃণামূলক বক্তব্য সনাক্তকরণ: Phi-2-এর উপর ভিত্তি করে HateTinyLLM মডেল LoRA fine-tuning ব্যবহার করে এই কাজে ৮০%-এর বেশি নির্ভুলতা অর্জন করে[18]
  • গেমিং কৌশল: SC-Phi2 মডেল StarCraft II গেমে কৌশল পূর্বানুমানে সক্ষমতা দেখিয়েছে[19]

দায়িত্বশীল AI এবং নিরাপত্তা

Phi পরিবারটি Microsoft Responsible AI মানদণ্ড অনুযায়ী তৈরি করা হয়েছে, যার মধ্যে জবাবদিহিতা, স্বচ্ছতা, ন্যায্যতা এবং নিরাপত্তার নীতি অন্তর্ভুক্ত। মডেলগুলি বহুমাত্রিক নিরাপত্তা মূল্যায়নের মধ্য দিয়ে যায়, যার মধ্যে Supervised Fine-Tuning (SFT) এবং Direct Preference Optimization (DPO), পাশাপাশি বিভিন্ন ভাষায় এবং ঝুঁকি বিভাগে পরীক্ষা অন্তর্ভুক্ত[20]

সীমাবদ্ধতা

চিত্তাকর্ষক ফলাফল সত্ত্বেও, Phi মডেলগুলি কিছু জটিল কাজে বিশেষায়িত বড় মডেলের কাছে পিছিয়ে পড়তে পারে। উদাহরণস্বরূপ, Phi-4 chain-of-thought যুক্তি-তর্কে ভালো ফলাফল দেখায়, কিন্তু function calling-এর অনুপস্থিতিতে সীমাবদ্ধ[21]। এছাড়াও, যদিও Phi-3.5 ২০টিরও বেশি ভাষা সমর্থন করে, তবে এর পারফরম্যান্স পরিবর্তিত হতে পারে এবং গবেষণা ইংরেজি ছাড়া অন্য ভাষায় উত্তরে অনির্ভুলতা দেখায়[22]

সাহিত্য

  • Gunasekar, S.; et al. (2023). Textbooks Are All You Need. arXiv:2306.11644.
  • Gunasekar, S.; et al. (2023). Textbooks Are All You Need II: phi‑1.5 Technical Report. arXiv:2309.05463.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Zheng, S.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models for Faster Decoding. arXiv:2305.13245.
  • Feng, W.; et al. (2024). Mixture‑of‑LoRAs: An Efficient Multitask Tuning for Large Language Models. arXiv:2403.03432.
  • Wu, X.; et al. (2024). Mixture of LoRA Experts. arXiv:2404.13628.
  • Microsoft Research (2024). Phi‑3 Technical Report. arXiv:2404.14219.
  • Abdin, M.; et al. (2024). Phi‑4 Technical Report. arXiv:2412.08905.
  • Microsoft Research (2025). Phi‑4‑reasoning Technical Report. PDF.
  • Microsoft Research (2025). Phi‑4‑Multimodal: Mixture‑of‑Modality‑LoRAs. arXiv:2503.01743.

টীকা

  1. «The Phi-3 small language models with big potential». Microsoft Source Features. [১]
  2. «Microsoft's Phi-3: Revolutionising AI with efficient and accessible small language models». Landing.Jobs Blog. [২]
  3. «Textbooks Are All You Need». Microsoft Research. [৩]
  4. «Introducing Phi-4: Microsoft’s newest Small Language Model, specializing in complex reasoning». Microsoft Tech Community. [৪]
  5. «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [৫]
  6. «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [৬]
  7. «Новая ИИ-модель Phi-2 от Microsoft училась по учебникам». TechInsider. [৭]
  8. «Phi-3 Technical Report». arXiv. [৮]
  9. «Discover the new multi-lingual, high-quality Phi-3.5 SLMs». Microsoft Tech Community. [৯]
  10. «Phi-4 Technical Report». arXiv. [১০]
  11. «Mixture-of-Modality-LoRAs: A Low-Rank Approach to Natively Multimodal Foundation Models». arXiv. [১১]
  12. «Phi-3: A Tutorial on Microsoft's Small Language Models (SLMs)». DataCamp. [১২]
  13. «Unlocking the Power of Small Language Models (SLMs): The Evolution of Phi». LinkedIn. [১৩]
  14. «Microsoft Phi». Microsoft Azure. [১৪]
  15. «Exploring Phi-4: A Deep Dive into Microsoft's Latest Language Model». OpenCV Blog. [১৫]
  16. «Phi-3.5-vision-instruct». Hugging Face. [১৬]
  17. «Small But Mighty: Exploring the Capabilities of Small Language Models in Medical and Sport-Specific Applications». arXiv. [১৭]
  18. «HateTinyLLMs: A Small Language Model for Hate Speech Detection». arXiv. [১৮]
  19. «SC-Phi2: A Specialized Small Language Model for StarCraft II». MDPI. [১৯]
  20. «Microsoft’s Phi-3.5: a responsible, small language model». Skymod. [২০]
  21. «Phi-4: A New Era of Small Language Models». Meta-quantum.today. [২১]
  22. «A Multi-faceted Analysis of Language-specific Bias in Large Language Models». U.S. Securities and Exchange Commission. [২২]