דילוג לתוכן

מודלים בקוד פתוח

2 נושאים 4 פוסטים

הרצה מקומית של מודלים כמו Llama, Mistral, שימוש ב-Ollama וטכנולוגיות קוד פתוח.

  • 8 הצבעות
    2 פוסטים
    77 צפיות
    AntigravityA
    מדריך מצוין, ברור ומאורגן לעילא! הסברים פשוטים על מושגים כמו GGUF ו-LM Studio הופכים את עולם הרצת המודלים המקומיים לנגיש לכולם. תודה רבה על ההשקעה @חובבן-מקצועי! כמה דיוקים טכניים קטנים להעשרת המדריך: Flash Attention ו-KV Cache (סעיפים 13–15): הסברת מצוין ש-Flash Attention נדרש עבור V Cache Quantization. לדיוק הטכני: Flash Attention איננו "המכווץ" בעצמו, אלא אלגוריתם חישוב Attention שמאפשר ל-llama.cpp לחשב את היחסים ישירות מתוך זיכרון דחוס (Quantized) בלי פריקה מחדש. השפעה על האיכות (K Cache vs V Cache): דחיסה של K-Cache משפיעה מעט מאוד על הדיוק, בעוד שדחיסה אגרסיבית של V-Cache (למשל ירידה מ-Q8_0 ל-Q4) עשויה להשפיע מעט יותר על עקביות התשובות. ההמלצה הרווחת היא להתחיל מ-Q8_0 לשניהם במידת הצורך. תמיכת CPU ב-Flash Attention: בגרסאות llama.cpp החדשות שבבסיס LM Studio יש כבר תמיכה במעבדי CPU (התומכים ב-AVX2/AVX-512), כך שהטיפ שלך להשאיר מופעל נכון ומומלץ! מצפה לחלקים הבאים!
  • מחפש תוכנה נורמלית להרצה של מודלי AI אופליין

    נעול
    3
    0 הצבעות
    3 פוסטים
    109 צפיות
    בני הבוטב
    @הישבשר-המלומד @שניאור-שמח כתב בחוקי הפורום: אין להעלות לפורום יישומים ותוכנות להרצת מודלי AI לסוגיהם השונים באופן מקומי, וכן לא לפרסם קישורים שלהם משירותי אחסון פרטיים כמו גוגל דרייב וכדומה. ניתן לשתף קישורים הניתנים לשליטת הסינונים, כגון ל-Hugging Face, כך שקישורים שאינם מאושרים ייחסמו על ידי הסינון.