DeepSeek (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

DeepSeek — একটি চীনা কৃত্রিম বুদ্ধিমত্তা গবেষণা প্রতিষ্ঠান, যা বৃহৎ ভাষা মডেল (LLM) এবং মাল্টিমোডাল সিস্টেম তৈরি করে। প্রতিষ্ঠানটি তার মডেলগুলোর ওজন (weights) উন্মুক্তভাবে বিতরণ এবং উচ্চ ব্যয়-কার্যকারিতার জন্য ব্যাপক পরিচিতি লাভ করেছে, যা ২০২৪ সালের শেষ থেকে ২০২৫ সালের শুরুতে AI বাজারে মূল্য সংশোধনকে ত্বরান্বিত করেছে।[1]

ইতিহাস

DeepSeek-এর প্রতিষ্ঠাতা হলেন উদ্যোক্তা এবং হেজ ফান্ড High‑Flyer-এর সহ-প্রতিষ্ঠাতা লিয়াং ওয়েনফেং। ২০২৩ সালের বসন্তে High‑Flyer তার AI গবেষণা বিভাগকে আলাদা করে, যা একই বছরের মে মাসে DeepSeek AI কোম্পানিতে পরিণত হয়। ২০২৫ সালের মধ্যে কর্মীসংখ্যা ~১৬০ জনে বৃদ্ধি পায়।[2] প্রতিষ্ঠার শুরু থেকেই কোম্পানিটি উন্মুক্ততার নীতি অনুসরণ করে — অনুমোদনমূলক লাইসেন্সের অধীনে ওজন («open‑weight») প্রকাশ করা এবং AGI-এর মৌলিক গবেষণার দিকে মনোনিবেশ করা।

অধিকাংশ স্টার্টআপের বিপরীতে, DeepSeek High‑Flyer-এর R&D বাজেট থেকে অর্থায়িত হয়, যা প্রতিষ্ঠাতার মতে, তাৎক্ষণিক মুনাফার পরিবর্তে দীর্ঘমেয়াদী লক্ষ্যে মনোনিবেশ করার সুযোগ দেয়।[3]

প্রযুক্তি ও আর্থিক সম্প্রদায়ে কোম্পানিটি ব্যাপক আলোড়ন সৃষ্টি করে ২০২৫ সালের জানুয়ারিতে DeepSeek-R1 মডেল প্রকাশের পর। GPT-4-এর সমতুল্য একটি মডেলের প্রশিক্ষণ মাত্র $৬ মিলিয়নেরও কম খরচে সম্পন্ন হয়েছে (GPT-4-এর জন্য $১০০+ মিলিয়নের অনুমানের তুলনায়) — এই দাবি প্রযুক্তি জায়ান্টগুলোর শেয়ারে ধস নামায় এবং শিল্পকে «বেশি কম্পিউটেশন = ভালো মডেল» প্যারাডাইম পুনর্বিবেচনা করতে বাধ্য করে।[4]

আর্কিটেকচারাল বৈশিষ্ট্য

Mixture‑of‑Experts (DeepSeekMoE)
DeepSeek-এর অধিকাংশ ফ্ল্যাগশিপ মডেল Mixture of Experts (MoE) আর্কিটেকচার ব্যবহার করে। «ঘন» মডেলের বিপরীতে, যেখানে প্রতিটি অনুরোধ প্রক্রিয়াকরণে সব প্যারামিটার সক্রিয় থাকে, MoE মডেলে প্রতিটি token-এর জন্য কেবলমাত্র বিশেষায়িত সাবনেটওয়ার্কের («বিশেষজ্ঞ») একটি ছোট অংশ সক্রিয় হয়। DeepSeek «সাধারণ» বিশেষজ্ঞ, সূক্ষ্মদানাদার বিভাজন এবং সহায়ক ক্ষতি ছাড়াই লোড ব্যালেন্সিং সহ MoE-এর নিজস্ব বাস্তবায়ন তৈরি করেছে, যা শত শত কোটি প্যারামিটারের মধ্যে থেকে কেবল একটি অংশ সক্রিয় করতে এবং গণনামূলক ব্যয় উল্লেখযোগ্যভাবে হ্রাস করতে সক্ষম করে।[5]
Multi‑Head Latent Attention (MLA)
KV‑cache-কে একটি latent ভেক্টরে সংকুচিত করার পদ্ধতি, যা ৯৩% পর্যন্ত মেমোরি সাশ্রয় করে এবং ১২৮,০০০ token পর্যন্ত context window ব্যবহার করতে সক্ষম করে। এই প্রযুক্তি দীর্ঘ পাঠ্যের সাথে দক্ষ কাজের জন্য মূল ভূমিকা রাখে।[6]
FP8 training এবং Multi‑Token Prediction
V3 পরিবারের মডেলগুলোতে মিশ্র নির্ভুলতার FP8 (৮-বিট ফ্লোটিং পয়েন্ট সংখ্যা) এবং একসাথে একাধিক token পূর্বাভাস ব্যবহার করা হয়, যা প্রশিক্ষণ ও inference (অনুমান) প্রক্রিয়াকে ত্বরান্বিত করে।[7]

মডেল পরিবার

  • DeepSeek LLM — ৭ এবং ৬৭ বিলিয়ন প্যারামিটারের বেস মডেল (২০২৩), প্রথম দ্বিভাষিক (EN/ZH) প্রকাশনা, যা বিভিন্ন কাজে LLaMA‑2 70B-কে ছাড়িয়ে গেছে।[8]
  • DeepSeek‑Coder (২০২৩) — প্রোগ্রামিংয়ের জন্য মডেলের একটি সিরিজ (১.৩ – ৩৩ বিলিয়ন) এবং এর উন্নয়ন Coder‑V2 (১৬ বিলিয়ন / ২৩৬ বিলিয়ন MoE, ১২৮K context, ৩৩৮টি কোডিং ভাষা)।[9]
  • DeepSeek‑V2 (মে ২০২৪) — ২৩৬ বিলিয়ন (২১ বিলিয়ন সক্রিয়) MoE‑LLM এবং MLA; ৮.১ ট্রিলিয়ন token-এ প্রশিক্ষিত।[10]
  • DeepSeek‑V3 (ডিসেম্বর ২০২৪) — ৬৭১ বিলিয়ন (৩৭ বিলিয়ন সক্রিয়); Nvidia H800-এ প্রশিক্ষণ ≈২.৮ মিলিয়ন GPU-ঘণ্টা, খরচ ≈$৫.৫ মিলিয়ন।[11]
  • DeepSeek‑R1 (জানুয়ারি ২০২৫) — যুক্তিতর্ক (reasoning)-এর জন্য মডেলের সিরিজ; R1‑0528 সংস্করণ AIME 2025 এবং LiveCodeBench-এ OpenAI o3-এর কাছাকাছি পৌঁছেছে।[12]
  • DeepSeek‑VL / VL2 — মাল্টিমোডাল VL মডেল (৪.৫ বিলিয়ন সক্রিয় পর্যন্ত) ১০২৪×১০২৪ ডায়নামিক মোজাইক ইমেজ প্রক্রিয়াকরণ সহ।[13]
  • DeepSeek‑Math 7B — বিশেষায়িত মডেল, MATH benchmark-এ ৫১.৭% নির্ভুলতা; GPT‑4-এর কাছাকাছি।[14]
  • DeepSeek‑Prover‑V2 — Lean 4-এ উপপাদ্য প্রমাণের জন্য ৬৭১ বিলিয়ন MoE; miniF2F-এ ৬৩.৫%।
  • পাতিত R1 মডেল — Llama এবং Qwen ভিত্তিতে ১.৫ থেকে ৭০ বিলিয়ন প্যারামিটারের উন্মুক্ত সংস্করণ।[15]

মূল প্রকাশনার কালক্রম

তারিখ প্রকাশনা ও মূল বৈশিষ্ট্য
২ নভে ২০২৩ DeepSeek‑Coder v1: কোডের জন্য প্রথম open‑weight মডেল।
২৯ নভে ২০২৩ DeepSeek LLM 7B/67B: ২ ট্রিলিয়ন token-এ প্রশিক্ষিত দ্বিভাষিক মডেল।
১১ জানু ২০২৪ DeepSeek‑MoE 16B: MoE আর্কিটেকচারের আত্মপ্রকাশ।
৬ ফেব্রু ২০২৪ DeepSeek‑Math 7B: গণিতের জন্য বিশেষায়িত মডেল (MATH-এ ৫১.৭%)।
৬ মে ২০২৪ DeepSeek‑V2 236B: MLA এবং MoE আর্কিটেকচার প্রবর্তন।
১৭ জুন ২০২৪ DeepSeek‑Coder‑V2: ১২৮K context, ৩৩৮টি প্রোগ্রামিং ভাষার সমর্থন।
১৩ ডিসে ২০২৪ DeepSeek‑VL2: MoE-ভিত্তিক মাল্টিমোডাল মডেল।
২৭ ডিসে ২০২৪ DeepSeek‑V3 671B: ফ্ল্যাগশিপ মডেল, $৬ মিলিয়নেরও কম খরচে প্রশিক্ষিত।
২০ জানু ২০২৫ DeepSeek‑R1 / R1‑Zero: RL ব্যবহার করে প্রশিক্ষিত reasoning মডেল।
২৭ জানু ২০২৫ Janus‑Pro: ছবি তৈরির মডেল, DALL‑E 3-কে ছাড়িয়ে গেছে।

কর্মক্ষমতা ও benchmark

  • DeepSeek‑V3 MMLU এবং GPQA‑Diamond-এ Llama 3.1 এবং Qwen 2.5-কে ছাড়িয়ে GPT‑4-এর মানের কাছাকাছি পৌঁছেছে।[16]
  • DeepSeek‑Coder‑V2 Arena‑Hard-এ ৭২.৯% অর্জন করেছে — GPT‑4o-এর সমতুল্য এবং Claude‑3.5‑Sonnet ছাড়া সকল উন্মুক্ত মডেলের চেয়ে উচ্চতর।[17]
  • DeepSeek‑Math 7B — MATH-এ ৫১.৭%, যা ১০ গুণ ছোট আকারে Gemini‑Ultra-এর কাছাকাছি।[18]
  • R1‑Zero শুধুমাত্র RL প্রশিক্ষণের মাধ্যমে AIME 2024 pass@1 ফলাফল ১৫.৬% থেকে ৭১%-এ উন্নীত করেছে।[19]

লাইসেন্সিং এবং open‑source

অধিকাংশ মডেল MIT বা Apache 2.0 লাইসেন্সের অধীনে বিতরণ করা হয়, যা বাণিজ্যিক ব্যবহারের অনুমতি দেয়। কোম্পানিটি Hugging Face এবং GitHub-এ ওজন প্রকাশ করে, তবে সম্পূর্ণ dataset এবং প্রশিক্ষণ pipeline গোপন রাখে («open weight, but not full open source»)।

শিল্পে প্রভাব

  • R1 লঞ্চ «$৬ মিলিয়নে GPT‑4 শ্রেণির মডেল»-এর সংবাদের প্রেক্ষিতে NVIDIA, Microsoft এবং অন্যান্য কোম্পানির শেয়ারে একদিনের ধসের কারণ হয়।[20]
  • রপ্তানি নিষেধাজ্ঞার আওতায় থাকা Nvidia H800 চিপে সফল প্রশিক্ষণের প্রদর্শনী মার্কিন নিষেধাজ্ঞার কার্যকারিতা নিয়ে আলোচনাকে উস্কে দিয়েছে এবং চীনা AI অ্যাক্সেলারেটরের (যেমন Huawei Ascend 910B) উন্নয়নকে ত্বরান্বিত করেছে।

সমালোচনা ও সীমাবদ্ধতা

  • নিরাপত্তা: HarmBench পরীক্ষায় R1 মডেল ১০০% অবাঞ্ছিত অনুরোধ («jailbreak») পাস করিয়েছে।
  • রাজনৈতিক সেন্সরশিপ: চ্যাট সংস্করণগুলো চীনা সরকারের কাছে «সংবেদনশীল» বিষয় ফিল্টার করে (১৯৮৯ সালের তিয়ানআনমেন স্কোয়ারের ঘটনা, তাইওয়ানের মর্যাদা ইত্যাদি)।
  • ডেটা সংরক্ষণ: চীনের সার্ভারে ব্যবহারকারীর ডেটা সংরক্ষণ GDPR এবং অনুরূপ আইনি কাঠামো মেনে চলা পশ্চিমা কর্পোরেশনগুলোর জন্য API ব্যবহার সীমিত করে।[21]

সাহিত্য

  • Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
  • Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
  • Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.

টীকা

  1. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  2. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  3. Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
  4. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  5. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  6. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  7. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  8. DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
  9. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  10. DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
  11. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  12. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  13. GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
  14. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  15. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  16. DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
  17. DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
  18. DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
  19. DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
  20. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
  21. DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.

আরও দেখুন

  • OpenAI-এর বৃহৎ ভাষা মডেল
  • Mixture-of-Experts