Ang Data Science ay isang hanay ng mga dalubhasang disiplina mula sa iba’t ibang larangan na sumusuri sa datos at naghahanap ng optimal na mga solusyon. Noong una, tanging matematikal na estadistika at aplikadong matematika lamang ang tumatalakay dito; kalaunan, ang machine learning at artificial intelligence ay pinagtibay, na nagdagdag ng computer science sa mga kasangkapan sa pagsusuri ng datos kasama ang matematikal na estadistika.
Sa pamamagitan ng pagsusuri ng malalaking dami ng datos, nagiging posible ang mas mabisang paggawa ng mga desisyon sa pamamahala. Ang mga benepisyo ng pagsusuri ng datos ay maaaring makuha sa halos anumang aplikadong larangan kung saan may sapat na datos. Upang maunawaan kung paano iaangkop ang pagsusuri ng datos sa isang partikular na larangan, kailangang magkaroon ng kadalubhasaan sa larangang iyon.
Sinasaklaw ng data science ang tatlong magkakaibang ngunit magkakapatong na larangan:
- ang mga kasanayan ng isang matematikal na estadistiko na kayang magmodelo ng mga dataset at kunin ang mahahalagang impormasyon mula rito;
- ang mga kasanayan ng isang computer scientist na kayang magdisenyo at gumamit ng mga algorithm para sa mahusay na pag-iimbak, pagproseso, at visualisasyon ng datos;
- ang kadalubhasaan sa larangan na nakamit sa pamamagitan ng tradisyunal na pag-aaral ng paksa — ang kakayahang parehong bumuo ng tamang mga tanong at suriin ang mga sagot sa naaangkop na konteksto.
Sa pag-iisip nito, iminumungkahi kong tingnan ang data science hindi bilang isang bagong larangan ng kaalaman na dapat pag-aralan, kundi bilang isang bagong hanay ng mga kasanayan na iaaplay sa isang larangang mahusay mo nang nakikilala.