নিজের কম্পিউটারে এআই মডেল চালানো: কার জন্য, আর কার জন্য নয়
|

নিজের কম্পিউটারে এআই মডেল চালানো: কার জন্য, আর কার জন্য নয়

On this page

    নিজের কম্পিউটারে এআই মডেল চালানো এখন আগের চেয়ে অনেক সহজ। একটি কমান্ডে মডেল নামানো যায়, ইন্টারনেট ছাড়াই চলে, আর কোনো মাসিক বিল নেই।

    কিন্তু শুরুতেই একটা কথা স্পষ্ট করে বলা দরকার। সবার জন্য এটা বুদ্ধিমান সিদ্ধান্ত নয়। কার জন্য লাভজনক আর কার জন্য নয়, সেটাই এই লেখার মূল বিষয়।

    সবচেয়ে জরুরি হিসাব: মেমরি

    কোন মডেল ভালো, এটা পরের প্রশ্ন। প্রথম প্রশ্ন হলো মডেলটি আপনার মেমরিতে পুরোটা প্রবেশ করে কি না।

    Ad space, reserved

    না করলে মডেল ধীরে চলবে না, বরং কার্যত অব্যবহারযোগ্য হয়ে যাবে। একটু অংশ র্যামে চলে গেলেই গতি কয়েক গুণ কমে যায়।

    হিসাবটি সহজ। প্রতি ১ বিলিয়ন প্যারামিটারের জন্য প্রয়োজন:

    প্রিসিশনপ্রতি প্যারামিটার৮বি মডেলে লাগবে
    FP16প্রায় ২ বাইটপ্রায় ১৬ জিবি
    Q8প্রায় ১ বাইটপ্রায় ৮ জিবি
    Q4_K_Mপ্রায় ০.৫ বাইটপ্রায় ৪.৫ জিবি

    এর সঙ্গে কন্টেক্সট উইন্ডো ও অন্যান্য খরচ বাবদ আরও ১ থেকে ২ জিবি যোগ করুন। তাই Q4_K_M তে একটি ৮বি মডেলের জন্য বাস্তবে বা ৬ জিবি দরকার।

    কোন র্যামে কী চলবে

    ভির্যাম / র্যামযতটুকু চলবেকাজের ধরন
    ৮ জিবি৭বি থেকে ৮বি, Q4সারসংক্ষেপ, শ্রেণীবিন্যাস, তথ্য বের করা
    ১২ জিবি৮বি স্বাচ্ছন্দ্যেএকই কাজ, বড় কন্টেক্সটসহ
    ১৬ থেকে ২৪ জিবি৩০বি শ্রেণী, Q4নির্দেশ অনুসরণ উল্লেখযোগ্য ভালো

    সত্যি কথা হলো, স্বয়ংক্রিয়তার জন্য যেসব কাজ আমরা আসলে করি — ট্রানসক্রিপ্ট সারসংক্ষেপ, তথ্য বের করা, খসড়া লেখা — সেগুলোতে ৮বি মডেলই যথেষ্ট।

    শুরু করার ধাপ

    Ollama ইনস্টল করার পর একটি মডেল নামান:

    ollama pull llama3.1:8b
    ollama run llama3.1:8b

    এরপর সবচেয়ে জরুরি কাজটি করুন, যেটি বেশিরভাগ মানুষ করেন না। মডেল সতিয়ই জিপিইউতে চলছে কি না যাচাই করুন:

    ollama ps
    
    # PROCESSOR কলামে যদি থাকে:
    #   100% GPU        -> ঠিক আছে
    #   48%/52% CPU/GPU -> এ কারণেই ধীর

    CPU ভাগ দেখালে তিনটি উপায় আছে: ছোট মডেল, বেশি কোয়ান্টাইজেশন, অথবা ছোট কন্টেক্সট। শেষেরটি সবচেয়ে কম খরচে সমাধান, কিন্তু সবচেয়ে কম আলোচিত।

    >>> /set parameter num_ctx 4096
    >>> /save llama31-8b-4k

    একটি লেকচারের ট্রানসক্রিপ্ট সারসংক্ষেপ করতে ৪০৯৬ টোকেনই যথেষ্ট। যে ১২৮কে কন্টেক্সট আপনি কখনো ব্যবহার করবেন না, সেটি শুধু মেমরি খাবে।

    কার জন্য এটা ঠিক নয়

    এই অংশটি সাধারণত কেউ লেখেন না, কিন্তু এটাই সবচেয়ে কাজের।

    • যদি আপনার কাজে সর্বোচ্চ মানের লেখা বা জটিল যুক্তি দরকার হয়, হোস্টেড মডেলই এখনো এগিয়ে।
    • যদি মাসে অল্প কয়েকবার এআই লাগে, এপিআইর খরচ এতই কম যে হার্ডওয়্যার কেনার যুক্তি নেই।
    • যদি গ্রাফিক্স কার্ড না থাকে, শুধু সিপিইউতে চালানোর অভিজ্ঞতা হতাশাজনক হবে।

    তাহলে কখন লোকাল মডেলই সঠিক সিদ্ধান্ত?

    • ডেটা বাইরে যাওয়া যাবে না। ক্লায়েন্টের ফুটেজ বা ট্রানসক্রিপ্ট তৃতীয় পক্ষের সার্ভারে পাঠানো ঠিক নয়। এটাই আমার মূল কারণ।
    • পরিমাণ বেশি। প্রতিদিন ডজনখানেক ভিডিও প্রক্রিয়া করলে এপিআইর খরচ জমতে থাকে।
    • ইন্টারনেট নির্ভরযোগ্য নয়। লোকাল মডেল লোডশেডিংের সময়েও চলে।

    কোয়ান্টাইজেশন নিয়ে সত্য কথা

    FP16 থেকে Q8 এ যাওয়ায় মানের পার্থক্য প্রায় নেই। Q8 থেকে Q4_K_M এ সামান্য পার্থক্য আছে, যা মূলত দীর্ঘ যুক্তির কাজে ধরা পড়ে। Q4 এর নিচে গেলে পার্থক্য আর সূক্ষ্ম থাকে না।

    তথ্য বের করার মতো বাঁধা কাজে Q4_K_M পুরোপুরি চলে। কারণ সেখানে আউটপুটের কাঠামো আগে থেকেই ঠিক করা থাকে, আর ভুল ধরা পড়ে যাচাইয়ের ধাপে।

    শেষ কথা

    যাঁরা বলেন লোকাল মডেল কাজের নয়, তাঁদের বেশিরভাগই এমন একটি মডেল চালিয়েছেন যার অর্ধেক সিপিইউতে ছিল, আর কন্টেক্সট ছিল প্রয়োজনের দশ গুণ।

    নতুন হার্ডওয়্যার কেনার আগে এই দুটি জিনিস ঠিক করুন। অনেক সময় এতেই সমস্যা শেষ হয়ে যায়।

    Ad space, reserved

    Similar Posts

    Leave a Reply

    Your email address will not be published. Required fields are marked *