DeepSeek (BN)
DeepSeek — একটি চীনা কৃত্রিম বুদ্ধিমত্তা গবেষণা প্রতিষ্ঠান, যা বৃহৎ ভাষা মডেল (LLM) এবং মাল্টিমোডাল সিস্টেম তৈরি করে। প্রতিষ্ঠানটি তার মডেলগুলোর ওজন (weights) উন্মুক্তভাবে বিতরণ এবং উচ্চ ব্যয়-কার্যকারিতার জন্য ব্যাপক পরিচিতি লাভ করেছে, যা ২০২৪ সালের শেষ থেকে ২০২৫ সালের শুরুতে AI বাজারে মূল্য সংশোধনকে ত্বরান্বিত করেছে।[1]
ইতিহাস
DeepSeek-এর প্রতিষ্ঠাতা হলেন উদ্যোক্তা এবং হেজ ফান্ড High‑Flyer-এর সহ-প্রতিষ্ঠাতা লিয়াং ওয়েনফেং। ২০২৩ সালের বসন্তে High‑Flyer তার AI গবেষণা বিভাগকে আলাদা করে, যা একই বছরের মে মাসে DeepSeek AI কোম্পানিতে পরিণত হয়। ২০২৫ সালের মধ্যে কর্মীসংখ্যা ~১৬০ জনে বৃদ্ধি পায়।[2] প্রতিষ্ঠার শুরু থেকেই কোম্পানিটি উন্মুক্ততার নীতি অনুসরণ করে — অনুমোদনমূলক লাইসেন্সের অধীনে ওজন («open‑weight») প্রকাশ করা এবং AGI-এর মৌলিক গবেষণার দিকে মনোনিবেশ করা।
অধিকাংশ স্টার্টআপের বিপরীতে, DeepSeek High‑Flyer-এর R&D বাজেট থেকে অর্থায়িত হয়, যা প্রতিষ্ঠাতার মতে, তাৎক্ষণিক মুনাফার পরিবর্তে দীর্ঘমেয়াদী লক্ষ্যে মনোনিবেশ করার সুযোগ দেয়।[3]
প্রযুক্তি ও আর্থিক সম্প্রদায়ে কোম্পানিটি ব্যাপক আলোড়ন সৃষ্টি করে ২০২৫ সালের জানুয়ারিতে DeepSeek-R1 মডেল প্রকাশের পর। GPT-4-এর সমতুল্য একটি মডেলের প্রশিক্ষণ মাত্র $৬ মিলিয়নেরও কম খরচে সম্পন্ন হয়েছে (GPT-4-এর জন্য $১০০+ মিলিয়নের অনুমানের তুলনায়) — এই দাবি প্রযুক্তি জায়ান্টগুলোর শেয়ারে ধস নামায় এবং শিল্পকে «বেশি কম্পিউটেশন = ভালো মডেল» প্যারাডাইম পুনর্বিবেচনা করতে বাধ্য করে।[4]
আর্কিটেকচারাল বৈশিষ্ট্য
- Mixture‑of‑Experts (DeepSeekMoE)
- DeepSeek-এর অধিকাংশ ফ্ল্যাগশিপ মডেল Mixture of Experts (MoE) আর্কিটেকচার ব্যবহার করে। «ঘন» মডেলের বিপরীতে, যেখানে প্রতিটি অনুরোধ প্রক্রিয়াকরণে সব প্যারামিটার সক্রিয় থাকে, MoE মডেলে প্রতিটি token-এর জন্য কেবলমাত্র বিশেষায়িত সাবনেটওয়ার্কের («বিশেষজ্ঞ») একটি ছোট অংশ সক্রিয় হয়। DeepSeek «সাধারণ» বিশেষজ্ঞ, সূক্ষ্মদানাদার বিভাজন এবং সহায়ক ক্ষতি ছাড়াই লোড ব্যালেন্সিং সহ MoE-এর নিজস্ব বাস্তবায়ন তৈরি করেছে, যা শত শত কোটি প্যারামিটারের মধ্যে থেকে কেবল একটি অংশ সক্রিয় করতে এবং গণনামূলক ব্যয় উল্লেখযোগ্যভাবে হ্রাস করতে সক্ষম করে।[5]
- Multi‑Head Latent Attention (MLA)
- KV‑cache-কে একটি latent ভেক্টরে সংকুচিত করার পদ্ধতি, যা ৯৩% পর্যন্ত মেমোরি সাশ্রয় করে এবং ১২৮,০০০ token পর্যন্ত context window ব্যবহার করতে সক্ষম করে। এই প্রযুক্তি দীর্ঘ পাঠ্যের সাথে দক্ষ কাজের জন্য মূল ভূমিকা রাখে।[6]
- FP8 training এবং Multi‑Token Prediction
- V3 পরিবারের মডেলগুলোতে মিশ্র নির্ভুলতার FP8 (৮-বিট ফ্লোটিং পয়েন্ট সংখ্যা) এবং একসাথে একাধিক token পূর্বাভাস ব্যবহার করা হয়, যা প্রশিক্ষণ ও inference (অনুমান) প্রক্রিয়াকে ত্বরান্বিত করে।[7]
মডেল পরিবার
- DeepSeek LLM — ৭ এবং ৬৭ বিলিয়ন প্যারামিটারের বেস মডেল (২০২৩), প্রথম দ্বিভাষিক (EN/ZH) প্রকাশনা, যা বিভিন্ন কাজে LLaMA‑2 70B-কে ছাড়িয়ে গেছে।[8]
- DeepSeek‑Coder (২০২৩) — প্রোগ্রামিংয়ের জন্য মডেলের একটি সিরিজ (১.৩ – ৩৩ বিলিয়ন) এবং এর উন্নয়ন Coder‑V2 (১৬ বিলিয়ন / ২৩৬ বিলিয়ন MoE, ১২৮K context, ৩৩৮টি কোডিং ভাষা)।[9]
- DeepSeek‑V2 (মে ২০২৪) — ২৩৬ বিলিয়ন (২১ বিলিয়ন সক্রিয়) MoE‑LLM এবং MLA; ৮.১ ট্রিলিয়ন token-এ প্রশিক্ষিত।[10]
- DeepSeek‑V3 (ডিসেম্বর ২০২৪) — ৬৭১ বিলিয়ন (৩৭ বিলিয়ন সক্রিয়); Nvidia H800-এ প্রশিক্ষণ ≈২.৮ মিলিয়ন GPU-ঘণ্টা, খরচ ≈$৫.৫ মিলিয়ন।[11]
- DeepSeek‑R1 (জানুয়ারি ২০২৫) — যুক্তিতর্ক (reasoning)-এর জন্য মডেলের সিরিজ; R1‑0528 সংস্করণ AIME 2025 এবং LiveCodeBench-এ OpenAI o3-এর কাছাকাছি পৌঁছেছে।[12]
- DeepSeek‑VL / VL2 — মাল্টিমোডাল VL মডেল (৪.৫ বিলিয়ন সক্রিয় পর্যন্ত) ১০২৪×১০২৪ ডায়নামিক মোজাইক ইমেজ প্রক্রিয়াকরণ সহ।[13]
- DeepSeek‑Math 7B — বিশেষায়িত মডেল, MATH benchmark-এ ৫১.৭% নির্ভুলতা; GPT‑4-এর কাছাকাছি।[14]
- DeepSeek‑Prover‑V2 — Lean 4-এ উপপাদ্য প্রমাণের জন্য ৬৭১ বিলিয়ন MoE; miniF2F-এ ৬৩.৫%।
- পাতিত R1 মডেল — Llama এবং Qwen ভিত্তিতে ১.৫ থেকে ৭০ বিলিয়ন প্যারামিটারের উন্মুক্ত সংস্করণ।[15]
মূল প্রকাশনার কালক্রম
| তারিখ | প্রকাশনা ও মূল বৈশিষ্ট্য |
|---|---|
| ২ নভে ২০২৩ | DeepSeek‑Coder v1: কোডের জন্য প্রথম open‑weight মডেল। |
| ২৯ নভে ২০২৩ | DeepSeek LLM 7B/67B: ২ ট্রিলিয়ন token-এ প্রশিক্ষিত দ্বিভাষিক মডেল। |
| ১১ জানু ২০২৪ | DeepSeek‑MoE 16B: MoE আর্কিটেকচারের আত্মপ্রকাশ। |
| ৬ ফেব্রু ২০২৪ | DeepSeek‑Math 7B: গণিতের জন্য বিশেষায়িত মডেল (MATH-এ ৫১.৭%)। |
| ৬ মে ২০২৪ | DeepSeek‑V2 236B: MLA এবং MoE আর্কিটেকচার প্রবর্তন। |
| ১৭ জুন ২০২৪ | DeepSeek‑Coder‑V2: ১২৮K context, ৩৩৮টি প্রোগ্রামিং ভাষার সমর্থন। |
| ১৩ ডিসে ২০২৪ | DeepSeek‑VL2: MoE-ভিত্তিক মাল্টিমোডাল মডেল। |
| ২৭ ডিসে ২০২৪ | DeepSeek‑V3 671B: ফ্ল্যাগশিপ মডেল, $৬ মিলিয়নেরও কম খরচে প্রশিক্ষিত। |
| ২০ জানু ২০২৫ | DeepSeek‑R1 / R1‑Zero: RL ব্যবহার করে প্রশিক্ষিত reasoning মডেল। |
| ২৭ জানু ২০২৫ | Janus‑Pro: ছবি তৈরির মডেল, DALL‑E 3-কে ছাড়িয়ে গেছে। |
কর্মক্ষমতা ও benchmark
- DeepSeek‑V3 MMLU এবং GPQA‑Diamond-এ Llama 3.1 এবং Qwen 2.5-কে ছাড়িয়ে GPT‑4-এর মানের কাছাকাছি পৌঁছেছে।[16]
- DeepSeek‑Coder‑V2 Arena‑Hard-এ ৭২.৯% অর্জন করেছে — GPT‑4o-এর সমতুল্য এবং Claude‑3.5‑Sonnet ছাড়া সকল উন্মুক্ত মডেলের চেয়ে উচ্চতর।[17]
- DeepSeek‑Math 7B — MATH-এ ৫১.৭%, যা ১০ গুণ ছোট আকারে Gemini‑Ultra-এর কাছাকাছি।[18]
- R1‑Zero শুধুমাত্র RL প্রশিক্ষণের মাধ্যমে AIME 2024 pass@1 ফলাফল ১৫.৬% থেকে ৭১%-এ উন্নীত করেছে।[19]
লাইসেন্সিং এবং open‑source
অধিকাংশ মডেল MIT বা Apache 2.0 লাইসেন্সের অধীনে বিতরণ করা হয়, যা বাণিজ্যিক ব্যবহারের অনুমতি দেয়। কোম্পানিটি Hugging Face এবং GitHub-এ ওজন প্রকাশ করে, তবে সম্পূর্ণ dataset এবং প্রশিক্ষণ pipeline গোপন রাখে («open weight, but not full open source»)।
শিল্পে প্রভাব
- R1 লঞ্চ «$৬ মিলিয়নে GPT‑4 শ্রেণির মডেল»-এর সংবাদের প্রেক্ষিতে NVIDIA, Microsoft এবং অন্যান্য কোম্পানির শেয়ারে একদিনের ধসের কারণ হয়।[20]
- রপ্তানি নিষেধাজ্ঞার আওতায় থাকা Nvidia H800 চিপে সফল প্রশিক্ষণের প্রদর্শনী মার্কিন নিষেধাজ্ঞার কার্যকারিতা নিয়ে আলোচনাকে উস্কে দিয়েছে এবং চীনা AI অ্যাক্সেলারেটরের (যেমন Huawei Ascend 910B) উন্নয়নকে ত্বরান্বিত করেছে।
সমালোচনা ও সীমাবদ্ধতা
- নিরাপত্তা: HarmBench পরীক্ষায় R1 মডেল ১০০% অবাঞ্ছিত অনুরোধ («jailbreak») পাস করিয়েছে।
- রাজনৈতিক সেন্সরশিপ: চ্যাট সংস্করণগুলো চীনা সরকারের কাছে «সংবেদনশীল» বিষয় ফিল্টার করে (১৯৮৯ সালের তিয়ানআনমেন স্কোয়ারের ঘটনা, তাইওয়ানের মর্যাদা ইত্যাদি)।
- ডেটা সংরক্ষণ: চীনের সার্ভারে ব্যবহারকারীর ডেটা সংরক্ষণ GDPR এবং অনুরূপ আইনি কাঠামো মেনে চলা পশ্চিমা কর্পোরেশনগুলোর জন্য API ব্যবহার সীমিত করে।[21]
সাহিত্য
- Dai, D. et al. (2024). DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models. arXiv:2401.06066.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jegham, N. et al. (2025). Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shen, Y. et al. (2025). Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy. arXiv:2502.05177.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Zhong, M. et al. (2024). Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective. arXiv:2406.13282.
টীকা
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.
- ↑ DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.
- ↑ DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.
- ↑ DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
- ↑ DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.
আরও দেখুন
- OpenAI-এর বৃহৎ ভাষা মডেল
- Mixture-of-Experts