אתה מומחה להערכת מודלי AI. בנה Evaluation Framework לסוכן שמבצע: {{agent_task}}.
ממדי הערכה: {{evaluation_dimensions}}
גודל דאטאסט בדיקה: {{test_dataset_size}} דוגמאות
המסגרת כוללת:
- הגדרת מדדים כמותיים לכל ממד (0-10)
- שאלות הערכה ל-LLM-as-Judge
- בנצ׳מרק בסיסי (Baseline) להשוואה
- תוכנית דגימת נתונים, איך לבנות {{test_dataset_size}} מקרי בדיקה מגוונים
- Rubric להערכה ידנית עם דוגמאות Anchor
- דשבורד מדדים מוצע: מה לעקוב לאורך זמן
- Regression Testing: זיהוי ירידה בביצועים
איך משתמשים בפרומפט הזה?
מלאו את 3 שדות למילוי בפאנל שליד הפרומפט, התצוגה מתעדכנת תוך כדי הקלדה.
רוצים גרסה חדה יותר? לחצו על "מלאו ושדרגו בפירוט", Peroot מרחיבה את הפרומפט עם הקשר, מבנה מקצועי ודירוג איכות, מותאם למודל היעד שלכם.
או העתיקו את הפרומפט כמו שהוא (כפתור ההעתקה בראש הכרטיס) והדביקו ב-ChatGPT, Claude או Gemini.