
আপনি হয়তো ভেবেছেন যে, মার্কিন যুক্তরাষ্ট্রের কোনো বড় কোম্পানির সার্ভার চালু থাকার ওপর নির্ভর না করে একটি শক্তিশালী কৃত্রিম বুদ্ধিমত্তা তৈরি করা সম্ভব কি না। এর উত্তর হলো, হ্যাঁ, এবং শুধু তাই নয়, রাস্পবেরি পাই-এর মতো একটি ছোট ডিভাইসে ল্যাঙ্গুয়েজ মডেল চালানো এখন আর শুধু প্রযুক্তিপ্রেমীদের পরীক্ষা-নিরীক্ষা নয়; এটি একটি কার্যকর এবং আশ্চর্যজনকভাবে দক্ষ প্রযুক্তিগত বিকল্পে পরিণত হয়েছে।
এজ কম্পিউটিং-এর কল্যাণেই এই জাদুটি সম্ভব হয় , যার মূল কথা হলো তথ্য যেখানে তৈরি হয় ঠিক সেখানেই তার প্রক্রিয়াকরণ করা। এআই-কে ডিভাইসে নিয়ে আসার মাধ্যমে আমরা ডেটার সম্পূর্ণ গোপনীয়তা অর্জন করি , কারণ কোনো কিছুই সিস্টেমের বাইরে যায় না। এর ফলে, প্রতিক্রিয়া পাওয়ার আগে ডেটাকে যখন হাজার হাজার কিলোমিটার ভ্রমণ করতে হয়, তখন যে বিরক্তিকর বিলম্ব ঘটে, তাও দূর হয়।
স্থানীয় এআই-এর জন্য আদর্শ হার্ডওয়্যার
আপনি যদি এই বিষয়ে গভীরভাবে জানতে চান, তবে যেকোনো বোর্ড হলেই চলবে না। রাস্পবেরি পাই ৫ হলো এর জন্য আদর্শ বিকল্প, কারণ এতে রয়েছে আর্ম কর্টেক্স-এ৭৬ প্রসেসর, যা ইনফারেন্স টাস্ক সামলানোর জন্য একটি সত্যিকারের শক্তিশালী যন্ত্র। একটি মসৃণ অভিজ্ঞতা নিশ্চিত করতে ৮ জিবি র্যামের মডেলটি থাকা অপরিহার্য , কারণ কোয়ান্টাইজড মডেলগুলো উল্লেখযোগ্য পরিমাণে র্যাম ব্যবহার করে এবং অপারেটিং সিস্টেমের কাজ করার জন্য পর্যাপ্ত জায়গার প্রয়োজন হয়।
একটি ক্ষেত্র যেখানে অনেকেই ভুল করেন তা হলো তাপমাত্রা। এলএলএম ইনফারেন্স কোরগুলোকে ১০০% পর্যন্ত ব্যবহার করে, যার ফলে প্রসেসর খুব দ্রুত গরম হয়ে ওঠে। থার্মাল থ্রটলিং- এর কারণে সিস্টেমের পারফরম্যান্স কমে যাওয়া রোধ করতে , অফিসিয়াল অ্যাক্টিভ কুলারটি কোনো ঐচ্ছিক অ্যাক্সেসরি নয়; এটি বাধ্যতামূলক। আপনি যদি না চান যে আপনার রাস্পবেরি পাই একটি টোস্টারে পরিণত হোক, তাহলে আপনার এই অ্যাক্টিভ কুলিং প্রয়োজন।
স্টোরেজের ক্ষেত্রে, যদিও একটি ক্লাস A2 মাইক্রোএসডি কার্ডই যথেষ্ট, কিন্তু যদি আপনি চান মডেলগুলো চোখের পলকে লোড হোক, তবে M.2 HAT-এর মাধ্যমে একটি NVMe SSD ব্যবহার করাই হলো আদর্শ সমাধান । এর পার্থক্য বিশাল: একটি ২জিবি মডেল লোড হতে ১২ সেকেন্ড থেকে কমে মাত্র ৩ বা ৪ সেকেন্ড সময় লাগতে পারে, যা এজ-এ যেকোনো অ্যাপ্লিকেশন স্থাপনের গতি বাড়িয়ে দেয় ।
এসএলএম বোঝা এবং পরিমাণ নির্ধারণ
রাস্পবেরি পাই-তে GPT-4 চালানোর চেষ্টার কথা ভুলে যান; এটা অনেকটা একটা ছোট গাড়িতে হাতি ঢোকানোর চেষ্টার মতো। এখানেই স্মল ল্যাঙ্গুয়েজ মডেল (SLM)-এর ভূমিকা আসে । এই মডেলগুলিতে সাধারণত কয়েকশ মিলিয়ন থেকে ৭ বা ৮ বিলিয়ন প্যারামিটার থাকে এবং এগুলি সামঞ্জস্যের সাথে খুব বেশি আপোস না করেই বিশেষভাবে সীমিত রিসোর্সযুক্ত ডিভাইসের জন্য ডিজাইন করা হয়েছে।
এই পদ্ধতিটি কার্যকর করার মূল চাবিকাঠি হলো GGUF কোয়ান্টাইজেশন । মূলত, এর মাধ্যমে মডেল ওয়েটগুলোর প্রিসিশন কমানো হয় (উদাহরণস্বরূপ, ১৬ বিট থেকে ৪ বিটে)। এর ফলে মডেলটি উল্লেখযোগ্যভাবে কম র্যাম ব্যবহার করে এবং টোকেন তৈরির গতি গ্রহণযোগ্য থাকে, যা মানুষের জন্য স্বাচ্ছন্দ্যপূর্ণ রিড স্পিড নিশ্চিত করে।
- লামা ৩.২ (১বি এবং ৩বি): বহুভাষিক সংলাপ এবং সারসংক্ষেপ তৈরির কাজের জন্য আদর্শ।
- জেমা ৩ এবং ৩এন: এগুলো এদের কার্যকারিতা এবং কিছু সংস্করণে থাকা দৃশ্যগত ক্ষমতার জন্য বিশেষভাবে উল্লেখযোগ্য।
- মাইক্রোসফট ফাই-৩.৫: যুক্তিতে অত্যন্ত পারদর্শী, যদিও মাঝে মাঝে তিনি একটু বেশিই কথা বলেন।
- টিনিলামা: গতির রাজা, সাধারণ হোম অটোমেশন কমান্ডের জন্য নিখুঁত।
ডেপ্লয়মেন্ট টুল: Ollama এবং Llama.cpp
এই সবকিছু চালু করার জন্য আমাদের কাছে দুটি প্রধান পথ রয়েছে। একদিকে, যারা সম্পূর্ণ নিয়ন্ত্রণ চান, তাদের জন্য Llama.cpp একটি বিকল্প। এটি আপনাকে সোর্স কোড কম্পাইল করার সুযোগ দেয়, যা ARM NEON এবং dotprod নির্দেশাবলীকে অপ্টিমাইজ করে এবং সিলিকন থেকে শক্তির শেষ বিন্দু পর্যন্ত নিংড়ে নেয়। পোর্ট 8080-এ একটি OpenAI-উপযোগী API উন্মুক্ত করার জন্য এবং পাই-কে লোকাল নেটওয়ার্কের অন্যান্য ডিভাইসের সাথে সংযুক্ত করার জন্য এটি আদর্শ।
অন্যদিকে, রয়েছে ওলামা (Ollama ), যা সম্ভবত বর্তমানে মডেল ম্যানেজ করার সবচেয়ে সহজ উপায়। টার্মিনালে কয়েকটি কমান্ডের মাধ্যমে আপনি কোনো ঝামেলা ছাড়াই লামা (Llama) বা জেমা (Gemma)-র মতো মডেল ডাউনলোড এবং রান করতে পারেন। ওলামা ব্যাকগ্রাউন্ডে একটি সার্ভার চালু করে, যা আপনাকে একটি অত্যন্ত সহজবোধ্য পাইথন লাইব্রেরির মাধ্যমে এআই (AI)-এর সাথে ইন্টারঅ্যাক্ট করার সুযোগ দেয় এবং কাস্টম স্ক্রিপ্ট তৈরি করা সহজ করে তোলে।
সিস্টেমকে অপ্টিমাইজ করার জন্য, বিশেষ করে রাস্পবেরি পাই ওএস-এর লাইট সংস্করণগুলোতে, সোয়াপ স্পেস বাড়িয়ে প্রায় ৪ জিবি করা অত্যাবশ্যক । এর ফলে, যখন চ্যাট মডেল এবং কনটেক্সট উপলব্ধ র্যাম পূর্ণ করতে শুরু করে, তখন OOM কিলার (আউট অফ মেমোরি) দ্বারা প্রসেসটি বন্ধ হয়ে যাওয়া প্রতিরোধ করা যায়।
প্রান্তে দৃষ্টি ও ভাষা মডেল (ভিএলএম)
যখন আমরা দৃষ্টিশক্তির সাথে বাকশক্তিকে একত্রিত করি, তখন বিষয়টি বেশ আকর্ষণীয় হয়ে ওঠে। ভিশন-ল্যাঙ্গুয়েজ মডেল (ভিএলএম) রাস্পবেরি পাইকে শুধু ছবি পড়তেই নয়, তা বুঝতেও সক্ষম করে। মুনড্রিম-এর মতো মডেলগুলো আশ্চর্যজনকভাবে দ্রুত এবং সরাসরি ডিভাইসেই দৃশ্য বর্ণনা করতে, বস্তু গণনা করতে বা ওসিআর সম্পাদন করতে সক্ষম।
এর একটি বাস্তব ও শক্তিশালী উদাহরণ হলো রাস্পবেরি পাই এআই ক্যামেরার ব্যবহার । ক্লাউডে সরাসরি ভিডিও পাঠানোর পরিবর্তে, ক্যামেরাটি সেন্সরেই ছবিটি প্রসেস করে এবং মেটাডেটা (যেমন অবজেক্ট ট্যাগ এবং কনফিডেন্স লেভেল) তৈরি করে। এরপর এই হালকা ডেটা এলএলএম-এ পাঠানো হয়, যা এটিকে মানুষের পাঠযোগ্য সারাংশে রূপান্তরিত করে । একটি ১ জিবি ভিডিও এবং একটি ১ কেবি টেক্সট ফাইল পাঠানোর মধ্যে এটাই হলো পার্থক্য।
এই পদ্ধতিটি খুচরা দোকানের তাক পর্যবেক্ষণের মতো বিভিন্ন অ্যাপ্লিকেশনের পথ খুলে দেয় , যেখানে মজুদ কম থাকলে সিস্টেমটি সতর্ক করে, অথবা কারখানার নজরদারির মাধ্যমে কর্মীরা সুরক্ষা সরঞ্জাম পরিধান করছেন কিনা তা পরীক্ষা করা যায় । এই পুরো প্রক্রিয়া জুড়েই, কোনো বাহ্যিক সার্ভারে ছবি আপলোড না করার মাধ্যমে গোপনীয়তা বজায় রাখা হয় এবং জিডিপিআর (GDPR) বিধিমালাও মেনে চলা হয়।
বাস্তব জগতের ব্যবহারিক উদাহরণ এবং অটোমেশন
আপনি যদি হোম অটোমেশনে আগ্রহী হন, তবে আপনার রাস্পবেরি পাই-কে একটি স্থানীয় নিয়ন্ত্রণ কেন্দ্রে পরিণত করতে পারেন । এমন একটি ভয়েস অ্যাসিস্ট্যান্টের কথা ভাবুন, যা Whisper.cpp ব্যবহার করে আপনার কণ্ঠস্বরকে প্রতিলিপি করে এবং একটি স্থানীয় LLM ব্যবহার করে সেই ইনটেন্টকে JSON-এ পার্স করে, যা পরবর্তীতে হোম অ্যাসিস্ট্যান্টে বিভিন্ন অ্যাকশন ট্রিগার করে। এই সবকিছুই ঘটে মিলিসেকেন্ডের মধ্যে এবং কোনো ইন্টারনেট সংযোগ ছাড়াই ।
শিল্পক্ষেত্রে, এই সিস্টেমগুলি পূর্বাভাসমূলক রক্ষণাবেক্ষণ বা রিয়েল-টাইম প্রক্রিয়া অপ্টিমাইজেশনের জন্য ব্যবহার করা যেতে পারে। এগুলি নির্ভুল কৃষিকাজের জন্যও অমূল্য, যেখানে একটি মোবাইল ডিভাইস 5G কভারেজের প্রয়োজন ছাড়াই মাঠে ফসলের স্বাস্থ্য বিশ্লেষণ করতে পারে।
প্রত্যন্ত অঞ্চলের শিক্ষামূলক উপকরণ থেকে শুরু করে প্রতিবন্ধী ব্যক্তিদের সহায়ক পর্যন্ত, এজ-এ জেনারেটিভ এআই চালানোর ক্ষমতা প্রযুক্তিতে সকলের প্রবেশাধিকার নিশ্চিত করে এবং এমন অতি-বিশেষায়িত সমাধান তৈরি করতে সক্ষম করে যা কোনো মাসিক ক্লাউড সাবস্ক্রিপশন ফি-র উপর নির্ভরশীল নয়।
৮০ ইউরোর একটি বোর্ডে স্থানীয়ভাবে ভাষা ও দৃষ্টি প্রক্রিয়াকরণ করার ক্ষমতা থাকাটা একটি বিশাল প্রযুক্তিগত অগ্রগতি। অপ্টিমাইজড হার্ডওয়্যার, কোয়ান্টাইজড মডেল এবং Ollama-র মতো টুলের সমন্বয়ে যেকোনো ডেভেলপার একটি দ্রুত, কার্যকর ও ব্যক্তিগত এআই ইকোসিস্টেম তৈরি করতে পারেন, যা বাস্তব জগতে সত্যিই কার্যকরী।
