הבעיה שיש לכל חברה ותיקה
עיצוב במה (Stage Design Israel) היא חברת בניית הבמות ותשתיות אירועי החוץ המובילה בישראל. כמו כל חברה עם עשרים שנות פעילות, יש לה ארכיון שאי אפשר לחפש בו: כ־34,000 שרטוטי אוטוקאד וכ־62,000 תמונות על כונני רשת, בתיקיות שהקונבנציה שלהן התחלפה שלוש פעמים עם השנים, עם שמות קבצים כמו DSC_1526.JPG ו־B09.dwg.
הזיכרון הארגוני קיים — "בנינו משהו כזה לפסטיבל ההוא ב־2011" — אבל למצוא את הקובץ עצמו אומר לשאול את האדם היחיד שזוכר, או שעה של חפירה בתיקיות. כשהוא עסוק, בחו"ל, או יום אחד פורש — הארכיון הופך לחור שחור.
נקודת המפנה: כל פתרון בשוק עלה יותר מהבעיה עצמה
לפתרונות המדף יש תמיד אותן שתי בעיות: שרתים ומנויים. כלים בהתקנה עצמית (ניסינו) זה Docker שנופל ומכונה שמישהו צריך לטפח. מוצרי חיפוש ארגוניים מתומחרים פר־משתמש, פר־חודש, לנצח — ואף אחד מהם לא באמת יודע עברית.
מה בנינו במקום
תיבת חיפוש. עובד משרד מקליד, בעברית חופשית, "במה עם תאורה ירוקה" — ומקבל בחזרה את התמונות והשרטוטים הנכונים מתוך כל 96,000 הקבצים, מדורגים לפי מה שבאמת נמצא בתוכם, בפחות משנייה.
מאחורי תיבת החיפוש:
- כל תמונה וכל שרטוט תוארו על ידי AI, בעברית ובאנגלית — תיאורים, תגיות, ואפילו תיאור לכל פנים בתמונה (מעל 57,000 פנים). החיפוש מוצא משמעות, לא רק שמות קבצים.
- עברית היא אזרחית מדרגה ראשונה. מנוע החיפוש מבין מורפולוגיה עברית (חיפוש אוהלים מוצא קבצים שתויגו אוהל), הממשק כולו RTL, וכל פלט AI הוא דו־לשוני — כך שגם חיפוש בעברית וגם באנגלית עובד.
- שרטוטים רואים, לא רק רואים ברשימה. קבצי CAD מקבלים תמונה ממוזערת שמחולצת מתוך קובץ ה־DWG עצמו — בלי רישיון אוטוקאד כדי לעיין בארכיון.
- כפילויות אותרו וסומנו בכל הארכיון — גם עותקים זהים וגם צילומים כמעט־זהים — בשיטת גיבוב על מטא־דאטה בלבד שאף פעם לא מורידה את הקובץ, בערך פי 100 מהר יותר מהגישה הרגילה.
- התחברות עם חשבון הגוגל של החברה. בלי סיסמאות חדשות, מוגבל לדומיין הארגוני, וההתחברות מתחדשת לבד ברקע.
התוצאות: החלק שנשמע בלתי אפשרי הוא החשבון
| סעיף | עלות |
|---|---|
| שרתים | 0 — פשוט אין |
| רישיונות תוכנה | 0 |
| עיבוד AI, ~86,000 תיאורים דו־לשוניים | 10$, חד־פעמי |
| עלות שוטפת חודשית | ≈ 0$ (free tiers) |
אין שרת בשום מקום במערכת. הארכיון נשאר איפה שהוא כבר חי (Google Drive, מסונכרן מה־NAS המשרדי). אינדקסר קל סורק אותו; API ובסיס נתונים serverless (Cloudflare Workers + D1 + R2) מחזיקים את אינדקס החיפוש והתמונות הממוזערות; הממשק הוא עמוד סטטי. הכול רץ בנוחות בתוך free tiers.
עבודת ה־AI — החלק שספקים מתמחרים בחמש ספרות — רצה על חוות מחשבים משרדיים ממוחזרים, מתואמת ברשת mesh פרטית, עם נפילה אוטומטית בין free tiers של שלושה ספקי AI. החיוב היחיד, 10$, היה פתיחת קרדיט חד־פעמית שהכפילה פי שלושה את התפוקה היומית. צבר עבודה שהוערך ב־10–11 שבועות התרוקן בישורת האחרונה בקצב של ~2,900 קבצים ביום.
מה למדנו בדרך הקשה (למה זה שירות, לא פרויקט סוף־שבוע)
פינת הכנות. מאחורי התוצאה המלוטשת יש חודשים של מבואות סתומים שהיום אנחנו יודעים לדלג עליהם:
- תצוגות CAD: ארבע שיטות חילוץ נכשלו (שתיים נעצרו על 12% הצלחה, שתיים על 0%) לפני שהחמישית — קריאת התמונה שאוטוקאד מטמיע בתוך ה־DWG עצמו — הגיעה לכ־95%.
- AI חינמי הוא אנטי־מקבילי. החווה הראשונה שלנו הריצה 10 מכונות מסונכרנות — הן שרפו את מכסת היום כולה בשעה אחת ושכבו מתות 23 שעות. שלוש מכונות עם פיזור אקראי הפיקו פי 3 יותר ביום מעשר. מנוגד לאינטואיציה, והשיעור התפעולי הכי שווה של הפרויקט.
- מודלי תרגום זולים ממציאים. מודל תרגום אחד הפך "נואם" לבחור בשם "נוח". כל פלט AI עובר היום שערי איכות; כשמצאנו בהמשך שכ־14% מהפלטים המוקדמים מתחת לרף של היום — התיקון היה שאילתת בסיס־נתונים אחת, והמערכת עיבדה את כולם מחדש לבד תוך ימים, כי כל הצנרת בנויה כמכונת מצבים שמרפאת את עצמה.
- עברית שוברת דברים. שיבושי קידוד, פריסת RTL, מורפולוגיה בחיפוש, עקביות דו־לשונית — כל שכבה דרשה החלטות מודעות־עברית שכלים גנריים לא עושים.
למי זה מתאים
אם יש לחברה שלכם שנים של שרטוטים, תמונות, מסמכים או סריקות על NAS או כונן משותף — ומציאת דבר תלויה בזיכרון של מישהו — הארכיטקטורה הזו נבנית מחדש בדיוק בשבילכם:
- חברות הפקה, הגברה ותאורה ובמות
- בוני תפאורות, תערוכות וסטים
- משרדי אדריכלות והנדסה
- יצרנים עם עשורים של היסטוריית CAD
- כל משרד דובר עברית שכלי החיפוש הגלובליים מפספסים
הקבצים נשארים אצלכם. אין שרתים לתחזק ואין תשלום פר־משתמש. עיבוד ה־AI הכבד הוא תהליך חד־פעמי בעלות שמתעגלת לאפס.
יש לכם ארכיון שאף אחד לא מצליח לחפש בו?
בשיחה אחת נגיד לכם אם הארכיטקטורה הזאת מתאימה לקבצים שלכם.
דברו איתנו