---
title: "DeepSeek (BN)"
source: "https://systems-analysis.info/int/DeepSeek_(BN)"
wiki: "systems-analysis.info/int"
article: "DeepSeek_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 1598
wiki_created_at: 2026-09-06T22:51:08Z
wiki_modified_at: 2026-09-06T22:51:08Z
downloaded_at: 2026-09-07T22:46:46Z
---

# DeepSeek (BN)

**DeepSeek** — একটি চীনা কৃত্রিম বুদ্ধিমত্তা গবেষণা প্রতিষ্ঠান, যা বৃহৎ ভাষা মডেল (LLM) এবং মাল্টিমোডাল সিস্টেম তৈরি করে। প্রতিষ্ঠানটি তার মডেলগুলোর ওজন (weights) উন্মুক্তভাবে বিতরণ এবং উচ্চ ব্যয়-কার্যকারিতার জন্য ব্যাপক পরিচিতি লাভ করেছে, যা ২০২৪ সালের শেষ থেকে ২০২৫ সালের শুরুতে AI বাজারে মূল্য সংশোধনকে ত্বরান্বিত করেছে।<sup>[\[1\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-1)</sup>

## ইতিহাস

DeepSeek-এর প্রতিষ্ঠাতা হলেন উদ্যোক্তা এবং হেজ ফান্ড *High‑Flyer*-এর সহ-প্রতিষ্ঠাতা লিয়াং ওয়েনফেং। ২০২৩ সালের বসন্তে High‑Flyer তার AI গবেষণা বিভাগকে আলাদা করে, যা একই বছরের মে মাসে *DeepSeek AI* কোম্পানিতে পরিণত হয়। ২০২৫ সালের মধ্যে কর্মীসংখ্যা ~১৬০ জনে বৃদ্ধি পায়।<sup>[\[2\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-2)</sup> প্রতিষ্ঠার শুরু থেকেই কোম্পানিটি উন্মুক্ততার নীতি অনুসরণ করে — অনুমোদনমূলক লাইসেন্সের অধীনে ওজন («open‑weight») প্রকাশ করা এবং AGI-এর মৌলিক গবেষণার দিকে মনোনিবেশ করা।

অধিকাংশ স্টার্টআপের বিপরীতে, DeepSeek High‑Flyer-এর R&D বাজেট থেকে অর্থায়িত হয়, যা প্রতিষ্ঠাতার মতে, তাৎক্ষণিক মুনাফার পরিবর্তে দীর্ঘমেয়াদী লক্ষ্যে মনোনিবেশ করার সুযোগ দেয়।<sup>[\[3\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-3)</sup>

প্রযুক্তি ও আর্থিক সম্প্রদায়ে কোম্পানিটি ব্যাপক আলোড়ন সৃষ্টি করে ২০২৫ সালের জানুয়ারিতে **DeepSeek-R1** মডেল প্রকাশের পর। GPT-4-এর সমতুল্য একটি মডেলের প্রশিক্ষণ মাত্র \$৬ মিলিয়নেরও কম খরচে সম্পন্ন হয়েছে (GPT-4-এর জন্য \$১০০+ মিলিয়নের অনুমানের তুলনায়) — এই দাবি প্রযুক্তি জায়ান্টগুলোর শেয়ারে ধস নামায় এবং শিল্পকে «বেশি কম্পিউটেশন = ভালো মডেল» প্যারাডাইম পুনর্বিবেচনা করতে বাধ্য করে।<sup>[\[4\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-4)</sup>

## আর্কিটেকচারাল বৈশিষ্ট্য

Mixture‑of‑Experts (DeepSeekMoE)  
DeepSeek-এর অধিকাংশ ফ্ল্যাগশিপ মডেল Mixture of Experts (MoE) আর্কিটেকচার ব্যবহার করে। «ঘন» মডেলের বিপরীতে, যেখানে প্রতিটি অনুরোধ প্রক্রিয়াকরণে সব প্যারামিটার সক্রিয় থাকে, MoE মডেলে প্রতিটি token-এর জন্য কেবলমাত্র বিশেষায়িত সাবনেটওয়ার্কের («বিশেষজ্ঞ») একটি ছোট অংশ সক্রিয় হয়। DeepSeek «সাধারণ» বিশেষজ্ঞ, সূক্ষ্মদানাদার বিভাজন এবং সহায়ক ক্ষতি ছাড়াই লোড ব্যালেন্সিং সহ MoE-এর নিজস্ব বাস্তবায়ন তৈরি করেছে, যা শত শত কোটি প্যারামিটারের মধ্যে থেকে কেবল একটি অংশ সক্রিয় করতে এবং গণনামূলক ব্যয় উল্লেখযোগ্যভাবে হ্রাস করতে সক্ষম করে।<sup>[\[5\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-5)</sup>

Multi‑Head Latent Attention (MLA)  
KV‑cache-কে একটি latent ভেক্টরে সংকুচিত করার পদ্ধতি, যা ৯৩% পর্যন্ত মেমোরি সাশ্রয় করে এবং ১২৮,০০০ token পর্যন্ত context window ব্যবহার করতে সক্ষম করে। এই প্রযুক্তি দীর্ঘ পাঠ্যের সাথে দক্ষ কাজের জন্য মূল ভূমিকা রাখে।<sup>[\[6\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-6)</sup>

FP8 training এবং Multi‑Token Prediction  
V3 পরিবারের মডেলগুলোতে মিশ্র নির্ভুলতার FP8 (৮-বিট ফ্লোটিং পয়েন্ট সংখ্যা) এবং একসাথে একাধিক token পূর্বাভাস ব্যবহার করা হয়, যা প্রশিক্ষণ ও inference (অনুমান) প্রক্রিয়াকে ত্বরান্বিত করে।<sup>[\[7\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-7)</sup>

## মডেল পরিবার

- **DeepSeek LLM** — ৭ এবং ৬৭ বিলিয়ন প্যারামিটারের বেস মডেল (২০২৩), প্রথম দ্বিভাষিক (EN/ZH) প্রকাশনা, যা বিভিন্ন কাজে *LLaMA‑2 70B*-কে ছাড়িয়ে গেছে।<sup>[\[8\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-8)</sup>
- **DeepSeek‑Coder** (২০২৩) — প্রোগ্রামিংয়ের জন্য মডেলের একটি সিরিজ (১.৩ – ৩৩ বিলিয়ন) এবং এর উন্নয়ন *Coder‑V2* (১৬ বিলিয়ন / ২৩৬ বিলিয়ন MoE, ১২৮K context, ৩৩৮টি কোডিং ভাষা)।<sup>[\[9\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-9)</sup>
- **DeepSeek‑V2** (মে ২০২৪) — ২৩৬ বিলিয়ন (২১ বিলিয়ন সক্রিয়) MoE‑LLM এবং MLA; ৮.১ ট্রিলিয়ন token-এ প্রশিক্ষিত।<sup>[\[10\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-10)</sup>
- **DeepSeek‑V3** (ডিসেম্বর ২০২৪) — ৬৭১ বিলিয়ন (৩৭ বিলিয়ন সক্রিয়); Nvidia H800-এ প্রশিক্ষণ ≈২.৮ মিলিয়ন GPU-ঘণ্টা, খরচ ≈\$৫.৫ মিলিয়ন।<sup>[\[11\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-11)</sup>
- **DeepSeek‑R1** (জানুয়ারি ২০২৫) — যুক্তিতর্ক (reasoning)-এর জন্য মডেলের সিরিজ; R1‑0528 সংস্করণ AIME 2025 এবং LiveCodeBench-এ *OpenAI o3*-এর কাছাকাছি পৌঁছেছে।<sup>[\[12\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-12)</sup>
- **DeepSeek‑VL / VL2** — মাল্টিমোডাল VL মডেল (৪.৫ বিলিয়ন সক্রিয় পর্যন্ত) ১০২৪×১০২৪ ডায়নামিক মোজাইক ইমেজ প্রক্রিয়াকরণ সহ।<sup>[\[13\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-13)</sup>
- **DeepSeek‑Math** 7B — বিশেষায়িত মডেল, MATH benchmark-এ ৫১.৭% নির্ভুলতা; GPT‑4-এর কাছাকাছি।<sup>[\[14\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-14)</sup>
- **DeepSeek‑Prover‑V2** — Lean 4-এ উপপাদ্য প্রমাণের জন্য ৬৭১ বিলিয়ন MoE; miniF2F-এ ৬৩.৫%।
- **পাতিত R1 মডেল** — Llama এবং Qwen ভিত্তিতে ১.৫ থেকে ৭০ বিলিয়ন প্যারামিটারের উন্মুক্ত সংস্করণ।<sup>[\[15\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-15)</sup>

## মূল প্রকাশনার কালক্রম

| তারিখ        | প্রকাশনা ও মূল বৈশিষ্ট্য                                                 |
|--------------|----------------------------------------------------------------------|
| ২ নভে ২০২৩   | **DeepSeek‑Coder v1:** কোডের জন্য প্রথম open‑weight মডেল।              |
| ২৯ নভে ২০২৩  | **DeepSeek LLM 7B/67B:** ২ ট্রিলিয়ন token-এ প্রশিক্ষিত দ্বিভাষিক মডেল।   |
| ১১ জানু ২০২৪  | **DeepSeek‑MoE 16B:** MoE আর্কিটেকচারের আত্মপ্রকাশ।                     |
| ৬ ফেব্রু ২০২৪  | **DeepSeek‑Math 7B:** গণিতের জন্য বিশেষায়িত মডেল (MATH-এ ৫১.৭%)।      |
| ৬ মে ২০২৪    | **DeepSeek‑V2 236B:** MLA এবং MoE আর্কিটেকচার প্রবর্তন।                 |
| ১৭ জুন ২০২৪   | **DeepSeek‑Coder‑V2:** ১২৮K context, ৩৩৮টি প্রোগ্রামিং ভাষার সমর্থন।    |
| ১৩ ডিসে ২০২৪ | **DeepSeek‑VL2:** MoE-ভিত্তিক মাল্টিমোডাল মডেল।                        |
| ২৭ ডিসে ২০২৪ | **DeepSeek‑V3 671B:** ফ্ল্যাগশিপ মডেল, \$৬ মিলিয়নেরও কম খরচে প্রশিক্ষিত। |
| ২০ জানু ২০২৫  | **DeepSeek‑R1 / R1‑Zero:** RL ব্যবহার করে প্রশিক্ষিত reasoning মডেল।    |
| ২৭ জানু ২০২৫  | **Janus‑Pro:** ছবি তৈরির মডেল, DALL‑E 3-কে ছাড়িয়ে গেছে।              |

## কর্মক্ষমতা ও benchmark

- *DeepSeek‑V3* MMLU এবং GPQA‑Diamond-এ *Llama 3.1* এবং *Qwen 2.5*-কে ছাড়িয়ে GPT‑4-এর মানের কাছাকাছি পৌঁছেছে।<sup>[\[16\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-16)</sup>
- *DeepSeek‑Coder‑V2* Arena‑Hard-এ ৭২.৯% অর্জন করেছে — GPT‑4o-এর সমতুল্য এবং Claude‑3.5‑Sonnet ছাড়া সকল উন্মুক্ত মডেলের চেয়ে উচ্চতর।<sup>[\[17\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-17)</sup>
- *DeepSeek‑Math 7B* — MATH-এ ৫১.৭%, যা ১০ গুণ ছোট আকারে Gemini‑Ultra-এর কাছাকাছি।<sup>[\[18\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-18)</sup>
- *R1‑Zero* শুধুমাত্র RL প্রশিক্ষণের মাধ্যমে AIME 2024 pass@1 ফলাফল ১৫.৬% থেকে ৭১%-এ উন্নীত করেছে।<sup>[\[19\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-19)</sup>

## লাইসেন্সিং এবং open‑source

অধিকাংশ মডেল MIT বা Apache 2.0 লাইসেন্সের অধীনে বিতরণ করা হয়, যা বাণিজ্যিক ব্যবহারের অনুমতি দেয়। কোম্পানিটি Hugging Face এবং GitHub-এ ওজন প্রকাশ করে, তবে সম্পূর্ণ dataset এবং প্রশিক্ষণ pipeline গোপন রাখে («open weight, but not full open source»)।

## শিল্পে প্রভাব

- R1 লঞ্চ «\$৬ মিলিয়নে GPT‑4 শ্রেণির মডেল»-এর সংবাদের প্রেক্ষিতে NVIDIA, Microsoft এবং অন্যান্য কোম্পানির শেয়ারে একদিনের ধসের কারণ হয়।<sup>[\[20\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-20)</sup>
- রপ্তানি নিষেধাজ্ঞার আওতায় থাকা Nvidia H800 চিপে সফল প্রশিক্ষণের প্রদর্শনী মার্কিন নিষেধাজ্ঞার কার্যকারিতা নিয়ে আলোচনাকে উস্কে দিয়েছে এবং চীনা AI অ্যাক্সেলারেটরের (যেমন Huawei Ascend 910B) উন্নয়নকে ত্বরান্বিত করেছে।

## সমালোচনা ও সীমাবদ্ধতা

- নিরাপত্তা: HarmBench পরীক্ষায় R1 মডেল ১০০% অবাঞ্ছিত অনুরোধ («jailbreak») পাস করিয়েছে।
- রাজনৈতিক সেন্সরশিপ: চ্যাট সংস্করণগুলো চীনা সরকারের কাছে «সংবেদনশীল» বিষয় ফিল্টার করে (১৯৮৯ সালের তিয়ানআনমেন স্কোয়ারের ঘটনা, তাইওয়ানের মর্যাদা ইত্যাদি)।
- ডেটা সংরক্ষণ: চীনের সার্ভারে ব্যবহারকারীর ডেটা সংরক্ষণ GDPR এবং অনুরূপ আইনি কাঠামো মেনে চলা পশ্চিমা কর্পোরেশনগুলোর জন্য API ব্যবহার সীমিত করে।<sup>[\[21\]](https://systems-analysis.info/int/DeepSeek_(BN)#cite_note-21)</sup>

## সাহিত্য

- Dai, D. et al. (2024). *DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture‑of‑Experts Language Models*. arXiv:2401.06066.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jegham, N. et al. (2025). *Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT*. arXiv:2502.16428.
- Lepikhin, D. et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shen, Y. et al. (2025). *Long‑VITA: Scaling Large Multi‑modal Models to 1 Million Tokens with Leading Short‑Context Accuracy*. arXiv:2502.05177.
- Su, J. et al. (2021). *RoFormer: Enhanced Transformer with Rotary Position Embedding*. arXiv:2104.09864.
- Zhong, M. et al. (2024). *Understanding the RoPE Extensions of Long‑Context LLMs: An Attention Perspective*. arXiv:2406.13282.

## টীকা

1.  <span id="cite_note-1">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-1) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
2.  <span id="cite_note-2">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-2) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
3.  <span id="cite_note-3">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-3) Who is Liang Wenfeng, the founder of DeepSeek? // Reuters. 2025-01-28.</span>
4.  <span id="cite_note-4">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-4) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
5.  <span id="cite_note-5">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-5) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
6.  <span id="cite_note-6">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-6) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
7.  <span id="cite_note-7">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-7) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
8.  <span id="cite_note-8">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-8) DeepSeek LLM: Scaling Open-Source Language Models with Longtermism // arXiv. 2024.</span>
9.  <span id="cite_note-9">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-9) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
10. <span id="cite_note-10">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-10) DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model // Hugging Face. 2024.</span>
11. <span id="cite_note-11">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-11) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
12. <span id="cite_note-12">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-12) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
13. <span id="cite_note-13">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-13) GitHub - deepseek-ai/DeepSeek-VL: Towards Real-World Vision-Language Understanding // GitHub.</span>
14. <span id="cite_note-14">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-14) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
15. <span id="cite_note-15">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-15) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
16. <span id="cite_note-16">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-16) DeepSeek-V3: A Parameter-Efficient MoE Large Language Model with Better Performance // arXiv. 2024.</span>
17. <span id="cite_note-17">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-17) DeepSeek-Coder-V2: A More Powerful and Economical Coder // arXiv. 2024.</span>
18. <span id="cite_note-18">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-18) DeepSeek-Math: Pushing the Limits of Mathematical Reasoning in Open-Source Models // arXiv. 2024.</span>
19. <span id="cite_note-19">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-19) DeepSeek-R1: A 671B Parameter MoE LLM with Unprecedented Reasoning Capabilities // arXiv. 2025.</span>
20. <span id="cite_note-20">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-20) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>
21. <span id="cite_note-21">[↑](https://systems-analysis.info/int/DeepSeek_(BN)#cite_ref-21) DeepSeek's low-cost AI spotlights billions spent by US tech // Reuters. 2025-01-27.</span>

## আরও দেখুন

- OpenAI-এর বৃহৎ ভাষা মডেল
- Mixture-of-Experts
