ખર્ચ કેમ વધે છે? ટોકન સિસ્ટમનું ગણિત
કોઈપણ એઆઇ સિસ્ટમ (AI System) માણસની ભાષાને સમજવા માટે ટેક્સ્ટને નાના-નાના ટુકડાઓમાં અથવા એકમોમાં વિભાજિત કરે છે, જેને ટેકનિકલ ભાષામાં 'ટોકન્સ' (Tokens) કહેવામાં આવે છે. જ્યારે તમે સિસ્ટમને કોઈ પ્રોમ્પ્ટ (Prompt) અથવા કમાન્ડ આપો છો, ત્યારે અંગ્રેજીની તુલનામાં હિન્દી કે અન્ય પ્રાદેશિક ભાષાઓમાં સમાન અર્થ વાળી વાત સમજવા માટે સિસ્ટમને વધુ ટોકન્સનો (Tokens) વપરાશ કરવો પડે છે. વધુ ટોકન્સ એટલે પ્રોસેસિંગનો વધુ ખર્ચ, જેનાથી બિન-અંગ્રેજી લોકો માટે આ પ્રક્રિયા ખર્ચાળ બની જાય છે.
Language Tax એટલે શું?
વિકાસકર્તાઓ અને સંશોધકો એઆઇ (AI) દ્વારા અલગ-અલગ ભાષાઓની પ્રોસેસિંગમાં આવતા આ ખર્ચના મોટા તફાવતને 'લેંગ્વેજ ટેક્સ' (Language Tax) અથવા એક પ્રકારનો છુપો ખર્ચ (Hidden Cost) કહે છે.
સંશોધનના ચોંકાવનારા આંકડા
તાજેતરમાં, ઓપનએઆઇના (OpenAI) રિસર્ચર અરન કોમાત્સુઝાકીએ (Aran Komatsuzaki) એક ઊંડો પ્રયોગ કર્યો હતો. તેમણે એઆઇ રિસર્ચર રિચ સટનના (Rich Sutton) જાણીતા લેખ "ધ બિટર લેસન" (The Bitter Lesson) નો આધાર લીધો. આ લેખનો વિવિધ ભાષાઓમાં અનુવાદ કરીને તેમણે અલગ-અલગ સિસ્ટમ્સના ટોકનાઇઝર્સ (Tokenizers) દ્વારા જનરેટ થતા ટોકન્સનું વિશ્લેષણ કર્યું.
બિન-અંગ્રેજી ભાષાઓ માટે ટોકનનો ખર્ચ વધુ
તાજેતરના એક બેન્ચમાર્ક ટેસ્ટના પરિણામોએ AI જગતમાં એક મોટો ખુલાસો કર્યો છે, જે મુજબ અંગ્રેજીની સરખામણીમાં હિન્દી સહિતની અન્ય ભાષાઓમાં ડેટા પ્રોસેસ કરવો ઘણો ખર્ચાળ સાબિત થાય છે. આંકડાકીય માહિતી અનુસાર, ઓપનએઆઇ (OpenAI) પ્લેટફોર્મ પર હિન્દી લખાણને પ્રોસેસ કરવા માટે અંગ્રેજી કરતા 1.37 ગણા વધારે ટોકન્સ વપરાય છે, પરંતુ એન્થ્રોપિક ક્લાઉડ (Anthropic Claude) સિસ્ટમમાં આ જ હિન્દી ટેક્સ્ટ માટે આ તફાવત અત્યંત મોટો એટલે કે 3.24 ગણો જોવા મળ્યો છે. માત્ર હિન્દી જ નહીં, પરંતુ ક્લાઉડ મોડેલ પર અરબી અને ચાઈનીઝ જેવી ભાષાઓના વપરાશમાં પણ અનુક્રમે 2.86 ગણા અને 1.71 ગણા વધુ ટોકન્સનો ખર્ચ થાય છે. આ આશ્ચર્યજનક ડેટા સ્પષ્ટપણે સાબિત કરે છે કે વૈશ્વિક સ્તરે સમાનતાનો દાવો કરતી આ એઆઇ સિસ્ટમ્સ બિન-અંગ્રેજી વપરાશકર્તાઓ માટે હજુ પણ વધુ ટોકન્સ વાપરીને એક પ્રકારનો અદ્રશ્ય આર્થિક બોજ વધારી રહી છે.
આ પણ વાંચો : AI Impact on Children : ભારતમાં 18 કરોડ બાળકો AI અને સ્માર્ટફોનની દુનિયામાં! શું નવી પેઢીનું ભવિષ્ય સંકટમાં?