آنتروپیک یک ابزار جدید برای ارزیابی پلاگین‌های Claude Code منتشر کرده که به توسعه‌دهنده‌ها اجازه می‌دهد پیش از انتشار، عملکرد واقعی اسکیل‌ها (Skills) را با داده و عدد بسنجند، نه فقط حدس بزنند که کار می‌کنند یا نه.

دستور claude plugin eval چه می‌کند

این ابزار از طریق دستور claude plugin eval روی هر پوشه‌ای اجرا می‌شود که یک فایل plugin.json یا .claude-plugin/plugin.json داشته باشد. دستور، پلاگین را با چند پرامپت واقعی اجرا می‌کند، خروجی Claude را نمره می‌دهد و نتیجه را با حالتی که پلاگین اصلاً بارگذاری نشده مقایسه می‌کند. به این ترتیب سه سوالی که تا پیش از این توسعه‌دهنده‌ها راه دقیقی برای اندازه‌گیریش نداشتند، پاسخ داده می‌شود: آیا اسکیل اصلاً فعال می‌شود؟ آیا بعد از یک ویرایش یا تغییر مدل هم درست کار می‌کند؟ و آیا واقعاً نسبت به یک مدل خام بهتر عمل می‌کند؟

این ابزار روی Claude Code نسخه‌ی ۲.۱.۲۶۹ به بعد کار می‌کند و هر اجرای ارزیابی، یک فراخوانی واقعی مدل است که از حساب کاربری یا API هزینه می‌کند.

ساختار یک کیس ارزیابی

هر مجموعه‌ی ارزیابی داخل پوشه‌ی evals/ پلاگین قرار می‌گیرد. هر کیس یک زیرپوشه است که شامل یک فایل prompt.md و یک پوشه‌ی graders/ می‌شود. متن پرامپت دقیقاً همان‌طور که نوشته شده به Claude داده می‌شود. در فرانت‌مَتر فایل پرامپت می‌توان مقادیری مثل max_turns (پیش‌فرض ۱۰)، timeout_seconds (پیش‌فرض ۳۰۰)، model، tags و allowed_tools را تنظیم کرد.

گریدرها هم فایل‌های مارک‌داون هستند که در فرانت‌متر خود یک type، و به‌صورت اختیاری weight و arm را مشخص می‌کنند. در مجموع شش نوع گریدر وجود دارد: چهار نوع — regex، tool_used، tool_order و file_exists — رایگان‌اند چون فقط از روی ترنسکریپت و فایل‌های روی دیسک محاسبه می‌شوند. دو نوع دیگر — llm و baseline — یک مدل داور را فرامی‌خوانند و هزینه‌بردارند؛ llm پاسخ را در برابر معیارهای نوشته‌شده به‌صورت متنی می‌سنجد و baseline آن را با یک پاسخ مرجع مقایسه می‌کند.

دستور claude plugin eval init هم به‌صورت خودکار پلاگین را می‌خواند، از کاربر می‌پرسد یک نتیجه‌ی خوب چه شکلی است، کیس‌ها و گریدرهای پیشنهادی را می‌سازد، آن‌ها را امتحان می‌کند و فایل‌های نهایی را می‌نویسد.

عدد کلیدی: دلتا (Δ)

به‌طور پیش‌فرض هر کیس دوبار اجرا می‌شود: یک‌بار با پلاگین بارگذاری‌شده و یک‌بار بدون آن. تفاوت این دو نتیجه، که آنتروپیک آن را Δ می‌نامد، دقیقاً نشان می‌دهد پلاگین چقدر واقعاً تأثیر داشته است. اگر یک کیس در هر دو حالت نمره‌ی یکسان بگیرد، یعنی پلاگین دلیل موفقیت آن نبوده. در نمونه‌ی مستندات رسمی، یک کیس در حالت «با پلاگین» نمره‌ی ۱.۰۰ و در حالت «بدون پلاگین» نمره‌ی ۰.۳۳ گرفته که Δ برابر با ۰.۶۷+ می‌شود، با هزینه‌ی تخمینی حدود ۰.۴۱ دلار و زمان اجرای ۷۴ ثانیه در مجموع ۶ اجرا.

طبق گفته‌ی آنتروپیک، رایج‌ترین مشکلی که این ابزار آشکار می‌کند، Δ نزدیک به صفر همراه با شکست‌خوردن گریدر tool_used: Skill است؛ یعنی Claude با عبارت‌های طبیعی کاربر، اصلاً سراغ آن اسکیل نمی‌رود. این دقیقاً همان نقصی است که ابزار قبلیِ اعتبارسنجی، یعنی claude plugin validate، نمی‌تواند تشخیص دهد؛ چون آن ابزار فقط ساختار و فرمت مانیفست را چک می‌کند، نه رفتار واقعی پلاگین را.

نتایج هر اجرا در مسیر evals/results/<timestamp>/report.html ذخیره می‌شود و شامل نتیجه‌ی هر گریدر و رأی‌های مدل داور است. در حساب‌هایی که امکانش را داشته باشند، این گزارش به‌صورت پیش‌فرض روی claude.ai هم منتشر می‌شود، مگر این‌که با فلگ --no-publish غیرفعال شود.

استفاده در CI

آنتروپیک یک دستور نمونه هم برای CI منتشر کرده، با فلگ‌هایی مثل --trust-plugin، --threshold، --model، --judge-model، --no-publish و --max-cost-usd، تا افت کیفیت یک پلاگین پیش از انتشار خودکار شناسایی شود. اجرا به یک نصب Claude Code و اعتبارنامه‌ای مثل ANTHROPIC_API_KEY نیاز دارد؛ بدون --trust-plugin، اجرای پلاگین از منبع نامعتبر در محیط بدون ترمینال رد می‌شود.

سوالات متداول

ابزار ارزیابی پلاگین Claude Code چه مشکلی را حل می‌کند؟ تا پیش از این، توسعه‌دهنده‌ها راه قابل‌اتکایی برای سنجش این‌که آیا یک اسکیل واقعاً فعال می‌شود و ارزش افزوده دارد یا نه، نداشتند. این ابزار با مقایسه‌ی عملکرد با و بدون پلاگین، این را با عدد نشان می‌دهد.

فرق آن با claude plugin validate چیست؟ validate فقط ساختار و فرمت مانیفست پلاگین را چک می‌کند؛ ابزار ارزیابی، رفتار واقعی پلاگین روی پرامپت‌های واقعی را می‌سنجد.

آیا اجرای ارزیابی هزینه دارد؟ هر اجرا حداقل یک فراخوانی مدل واقعی است. گریدرهای regex، tool_used، tool_order و file_exists رایگان‌اند، اما گریدرهای llm و baseline از مدل داور استفاده می‌کنند و هزینه‌بردارند.

این ابزار روی چه نسخه‌ای از Claude Code کار می‌کند؟ Claude Code نسخه‌ی ۲.۱.۲۶۹ به بعد.

جمع‌بندی

با معرفی ابزار ارزیابی پلاگین، آنتروپیک عملاً یک لایه‌ی سنجش کمّی به اکوسیستم پلاگین‌های Claude Code اضافه کرده که پیش‌تر وجود نداشت. برای توسعه‌دهنده‌هایی که اسکیل می‌سازند، این یعنی امکان تشخیص زودهنگام این‌که آیا یک پلاگین واقعاً روی پرامپت‌های طبیعی فعال می‌شود یا فقط در تست‌های دستی جواب می‌دهد.


منبع: MarkTechPost