নিজের কম্পিউটারে এআই মডেল চালানো: কার জন্য, আর কার জন্য নয়
On this page
নিজের কম্পিউটারে এআই মডেল চালানো এখন আগের চেয়ে অনেক সহজ। একটি কমান্ডে মডেল নামানো যায়, ইন্টারনেট ছাড়াই চলে, আর কোনো মাসিক বিল নেই।
কিন্তু শুরুতেই একটা কথা স্পষ্ট করে বলা দরকার। সবার জন্য এটা বুদ্ধিমান সিদ্ধান্ত নয়। কার জন্য লাভজনক আর কার জন্য নয়, সেটাই এই লেখার মূল বিষয়।
সবচেয়ে জরুরি হিসাব: মেমরি
কোন মডেল ভালো, এটা পরের প্রশ্ন। প্রথম প্রশ্ন হলো মডেলটি আপনার মেমরিতে পুরোটা প্রবেশ করে কি না।
Ad space, reserved
না করলে মডেল ধীরে চলবে না, বরং কার্যত অব্যবহারযোগ্য হয়ে যাবে। একটু অংশ র্যামে চলে গেলেই গতি কয়েক গুণ কমে যায়।
হিসাবটি সহজ। প্রতি ১ বিলিয়ন প্যারামিটারের জন্য প্রয়োজন:
| প্রিসিশন | প্রতি প্যারামিটার | ৮বি মডেলে লাগবে |
|---|---|---|
| FP16 | প্রায় ২ বাইট | প্রায় ১৬ জিবি |
| Q8 | প্রায় ১ বাইট | প্রায় ৮ জিবি |
| Q4_K_M | প্রায় ০.৫ বাইট | প্রায় ৪.৫ জিবি |
এর সঙ্গে কন্টেক্সট উইন্ডো ও অন্যান্য খরচ বাবদ আরও ১ থেকে ২ জিবি যোগ করুন। তাই Q4_K_M তে একটি ৮বি মডেলের জন্য বাস্তবে বা ৬ জিবি দরকার।
কোন র্যামে কী চলবে
| ভির্যাম / র্যাম | যতটুকু চলবে | কাজের ধরন |
|---|---|---|
| ৮ জিবি | ৭বি থেকে ৮বি, Q4 | সারসংক্ষেপ, শ্রেণীবিন্যাস, তথ্য বের করা |
| ১২ জিবি | ৮বি স্বাচ্ছন্দ্যে | একই কাজ, বড় কন্টেক্সটসহ |
| ১৬ থেকে ২৪ জিবি | ৩০বি শ্রেণী, Q4 | নির্দেশ অনুসরণ উল্লেখযোগ্য ভালো |
সত্যি কথা হলো, স্বয়ংক্রিয়তার জন্য যেসব কাজ আমরা আসলে করি — ট্রানসক্রিপ্ট সারসংক্ষেপ, তথ্য বের করা, খসড়া লেখা — সেগুলোতে ৮বি মডেলই যথেষ্ট।
শুরু করার ধাপ
Ollama ইনস্টল করার পর একটি মডেল নামান:
ollama pull llama3.1:8b
ollama run llama3.1:8bএরপর সবচেয়ে জরুরি কাজটি করুন, যেটি বেশিরভাগ মানুষ করেন না। মডেল সতিয়ই জিপিইউতে চলছে কি না যাচাই করুন:
ollama ps
# PROCESSOR কলামে যদি থাকে:
# 100% GPU -> ঠিক আছে
# 48%/52% CPU/GPU -> এ কারণেই ধীরCPU ভাগ দেখালে তিনটি উপায় আছে: ছোট মডেল, বেশি কোয়ান্টাইজেশন, অথবা ছোট কন্টেক্সট। শেষেরটি সবচেয়ে কম খরচে সমাধান, কিন্তু সবচেয়ে কম আলোচিত।
>>> /set parameter num_ctx 4096
>>> /save llama31-8b-4kএকটি লেকচারের ট্রানসক্রিপ্ট সারসংক্ষেপ করতে ৪০৯৬ টোকেনই যথেষ্ট। যে ১২৮কে কন্টেক্সট আপনি কখনো ব্যবহার করবেন না, সেটি শুধু মেমরি খাবে।
কার জন্য এটা ঠিক নয়
এই অংশটি সাধারণত কেউ লেখেন না, কিন্তু এটাই সবচেয়ে কাজের।
- যদি আপনার কাজে সর্বোচ্চ মানের লেখা বা জটিল যুক্তি দরকার হয়, হোস্টেড মডেলই এখনো এগিয়ে।
- যদি মাসে অল্প কয়েকবার এআই লাগে, এপিআইর খরচ এতই কম যে হার্ডওয়্যার কেনার যুক্তি নেই।
- যদি গ্রাফিক্স কার্ড না থাকে, শুধু সিপিইউতে চালানোর অভিজ্ঞতা হতাশাজনক হবে।
তাহলে কখন লোকাল মডেলই সঠিক সিদ্ধান্ত?
- ডেটা বাইরে যাওয়া যাবে না। ক্লায়েন্টের ফুটেজ বা ট্রানসক্রিপ্ট তৃতীয় পক্ষের সার্ভারে পাঠানো ঠিক নয়। এটাই আমার মূল কারণ।
- পরিমাণ বেশি। প্রতিদিন ডজনখানেক ভিডিও প্রক্রিয়া করলে এপিআইর খরচ জমতে থাকে।
- ইন্টারনেট নির্ভরযোগ্য নয়। লোকাল মডেল লোডশেডিংের সময়েও চলে।
কোয়ান্টাইজেশন নিয়ে সত্য কথা
FP16 থেকে Q8 এ যাওয়ায় মানের পার্থক্য প্রায় নেই। Q8 থেকে Q4_K_M এ সামান্য পার্থক্য আছে, যা মূলত দীর্ঘ যুক্তির কাজে ধরা পড়ে। Q4 এর নিচে গেলে পার্থক্য আর সূক্ষ্ম থাকে না।
তথ্য বের করার মতো বাঁধা কাজে Q4_K_M পুরোপুরি চলে। কারণ সেখানে আউটপুটের কাঠামো আগে থেকেই ঠিক করা থাকে, আর ভুল ধরা পড়ে যাচাইয়ের ধাপে।
শেষ কথা
যাঁরা বলেন লোকাল মডেল কাজের নয়, তাঁদের বেশিরভাগই এমন একটি মডেল চালিয়েছেন যার অর্ধেক সিপিইউতে ছিল, আর কন্টেক্সট ছিল প্রয়োজনের দশ গুণ।
নতুন হার্ডওয়্যার কেনার আগে এই দুটি জিনিস ঠিক করুন। অনেক সময় এতেই সমস্যা শেষ হয়ে যায়।
Ad space, reserved





