মেশিন লার্নিং মডেলগুলি প্রম্পট ইনজেকশন আক্রমণ থেকে কৃত্রিম বুদ্ধিমত্তাকে আরও ভালভাবে রক্ষা করে

“`html

মেশিন লার্নিং মডেলগুলি প্রম্পট ইনজেকশন আক্রমণ থেকে কৃত্রিম বুদ্ধিমত্তাকে আরও ভালভাবে রক্ষা করে

আধুনিক কৃত্রিম বুদ্ধিমত্তা, বিশেষ করে বড় ভাষা মডেলগুলি, ক্রমবর্ধমানভাবে প্রম্পট ইনজেকশন আক্রমণের সম্মুখীন হচ্ছে। এই আক্রমণগুলি দুষ্ট অভিনেতাদের মডেলের প্রতিক্রিয়াগুলিকে নিয়ন্ত্রণ করতে, সুরক্ষা ব্যবস্থাগুলিকে বাইপাস করতে এবং তাদের ডিজাইনারদের দ্বারা অনুমোদিত নয় এমন আচরণ পেতে সক্ষম করে। এই ধরনের হেরফের ডেটা লিক, পরিচয় জালিয়াতি বা অন্যান্য গুরুতর পরিণতির দিকে নিয়ে যেতে পারে, যা প্রত্যক্ষভাবে কোয়েরিতে ইনজেকশনের মাধ্যমে বা ওয়েবসাইট বা ফাইলগুলির মতো বহিরাগত উৎসগুলি এক্সপ্লয়েট করার মাধ্যমে হতে পারে।

এই হুমকির মোকাবিলা করতে, মেশিন লার্নিং পদ্ধতিগুলি এই হেরফেরের প্রচেষ্টাগুলি শনাক্ত করার জন্য মূল্যায়ন করা হয়েছে। চারটি প্রধান পদ্ধতি তুলনা করা হয়েছে: টেক্সটের ভেক্টর উপস্থাপনা ব্যবহার করে ঐতিহ্যগত শ্রেণীবদ্ধকারী, টাস্কের জন্য সামঞ্জস্য করা ট্রান্সফরমার মডেল, প্রম্পট ইনজেকশন সনাক্তকরণে বিশেষায়িত মডেল এবং শ্রেণীবদ্ধকারী হিসাবে ব্যবহৃত বড় ভাষা মডেলগুলি।

ঐতিহ্যগত শ্রেণীবদ্ধকারী, যেমন র‍্যান্ডম ফরেস্ট বা মাল্টি-লেয়ার নিউরাল নেটওয়ার্ক, ভালো নির্ভুলতা প্রদান করে এবং কম কম্পিউটিং সম্পদ প্রয়োজন করে। এগুলি উল্লেখযোগ্য কর্মক্ষমতা অর্জন করে, কখনও কখনও ক্ষতিকর প্রম্পট সনাক্তকরণের জন্য ৯৬% এর বেশি স্কোর করে। তাদের সরলতা তাদেরকে সীমিত সম্পদ সহ পরিবেশের জন্য উপযুক্ত করে তোলে।

সামঞ্জস্য করা ট্রান্সফরমার মডেল, যেমন DistilBERT, RoBERTa বা DeBERTa, প্রায় ৯৯.৬% নির্ভুলতার সাথে আক্রমণ সনাক্ত করতে সক্ষম। এই মডেলগুলি, আরও জটিল হওয়ায়, টেক্সটের অর্থকে সূক্ষ্মভাবে বিশ্লেষণ করে এবং উচ্চ নির্ভরযোগ্যতার সাথে হেরফেরের প্রচেষ্টাগুলি শনাক্ত করে। তাদের প্রধান অসুবিধা হল উচ্চ কম্পিউটেশনাল খরচ, যা দ্রুত প্রতিক্রিয়া প্রয়োজন এমন সিস্টেমে তাদের মোতায়েনকে সীমিত করতে পারে।

প্রম্পট ইনজেকশন সনাক্তকরণের জন্য বিশেষভাবে ডিজাইন করা মডেলগুলি মিশ্র ফলাফল দেখায়। যদিও এগুলি এই কাজের জন্য অপ্টিমাইজ করা হয়েছে, তাদের সনাক্তকরণের হার প্রায়শই নিম্ন থাকে, কখনও কখনও রিকল স্কোর ২৫% এর নিচে থাকে। এর মানে হল তারা অনেক আক্রমণকে অগ্রাহ্য করে, যা তাদের ব্যবহারিক উপযোগিতা হ্রাস করে।

অন্তত, সাধারণ বড় ভাষা মডেলগুলি, যেমন gpt-5-nano, এই আক্রমণগুলি সনাক্ত করতেও ব্যবহৃত হতে পারে। ৮৪% নির্ভুলতা এবং ৭১% রিকলের সাথে, এগুলি কর্মক্ষমতা এবং বহুমুখীতার মধ্যে একটি আকর্ষণীয় ভারসাম্য প্রদান করে। তাদের শক্তি হল বিভিন্ন ধরনের কোয়েরির সাথে খাপ খাইয়ে নেওয়ার ক্ষমতা, কোনো বিশেষ প্রশিক্ষণের প্রয়োজন ছাড়াই।

এই বিশ্লেষণটি দেখায় যে কোনো পদ্ধতি সব কনটেক্সটে অন্যান্য পদ্ধতিগুলিকে ছাড়িয়ে যায় না। ঐতিহ্যগত শ্রেণীবদ্ধকারী হালকা সিস্টেমের জন্য উপযুক্ত, যখন সামঞ্জস্য করা ট্রান্সফরমার মডেলগুলি সেখানে উত্তম যেখানে নির্ভুলতা গতির চেয়ে বেশি গুরুত্বপূর্ণ। বিশেষায়িত মডেলগুলি, যদিও প্রতিশ্রুতিশীল, অন্যান্য পদ্ধতিগুলির সাথে প্রতিযোগিতা করার জন্য এখনও উন্নতি করতে হবে। বড় ভাষা মডেলগুলি একটি নমনীয় সমাধান উপস্থাপন করে, তবে তাদের মোতায়েন প্রযুক্তিগত সীমাবদ্ধতা এবং নির্দিষ্ট চাহিদার উপর নির্ভর করে।

“`


Bases documentaires

Rapport de référence

DOI : https://doi.org/10.1007/s10207-026-01264-8

Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks

Revue : International Journal of Information Security

Éditeur : Springer Science and Business Media LLC

Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora

Speed Reader

Ready
500