Digercules לארגונים

רוב הכלים לעבודה עם נתונים ארגוניים דורשים שכבר תדעו איזה סוג ארכיון יש לכם. תוכנת עריכת דין דורשת תיקים משפטיים. קטלוג מדיה דורש חומר מצולם. כלי ביקורת נתונים ארגוניים (בדרך כלל נקראים data governance — שירותים כמו BigID או IBM Guardium) יודעים למצוא נתונים אישיים בקבצים ולהעריך סיכון דליפה, אבל לא יודעים לומר מה יש בפועל בתוך הקובץ, מבחינת המשמעות.

Digercules מתחיל משאלה אחרת: מה בעצם יש כאן? הביאו מסה לא ממוינת — מחשב של עובד שעזב, ארכיון תיקים ישן, עשרות שנים של חומר גולמי, הקלטות של ערבים שחלפו במועדון מוזיקלי או ספרותי, היסטוריית תכתובת עם לקוחות — וקבלו, לא רשימת קבצים, אלא ספרייה מובנית. לכל קובץ בנפרד — נושא, שפה, סוג מסמך, ישויות מפתח, תקציר. זה נעשה מראש, בלי לחץ ובלי דדליין, לפני שמישהו זקוק לזה בדחיפות — לא ברגע האחרון תחת לחץ למשימה ספציפית. את הספרייה המוכנה אפשר להזין לכל רשת נוירונים, מסד נתונים או מנוע חיפוש — מכאן הם ממשיכים לבד, מוצאים את הנדרש ובונים את הממשק; Digercules לא מחליפה את השלב הבא הזה, היא הופכת אותו לאפשרי מלכתחילה, בכך שהיא לוקחת על עצמה את ההכנה הדורשת עבודה רבה שלעולם אין לה משאבים.

הטכנולוגיה כבר עובדת — מספרים אמיתיים מהפרויקטים שעובדו:

+800,000
קבצים עובדו
כ-85 טרה-בייט
נפח המקור
+66,000 שעות
אודיו (כ-7.5 שנים)
1.8 טרה-בייט
שוחררו בדדופליקציה
3,507 שעות
הושקעו בעיבוד
~430
מבצעים זוהו בווידאו

בערוץ התקשורת הזמין (כ-30 מגהביט לשנייה, נמדד בפועל) העלאת נפח כזה לענן הייתה אורכת כ-262 ימים — לעומת 96 הימים שבהם זה עובד בפועל במקום. האחסון היה עולה מ-$84 לחודש, והעיבוד על GPU בעוצמה דומה היה עולה מ-$150–190 לחודש. וזה בלי לספור עוד שלב: הנתונים עדיין צריכים לעבור מהאחסון אל מכונת ה-GPU עצמה לצורך העיבוד — גם בערוץ מהיר פי שלושה (100 מגהביט לשנייה), אצווה של כמה טרה-בייט לוקחת בערך 3 ימים.

איך זה עובד

העיבוד מתבצע כולו על המחשב של הלקוח, או — אם העוצמה אינה מספיקה — מואצל למכונה חיצונית ספציפית דרך ערוץ עמית-לעמית סגור (לא ענן ציבורי): כוח המחשוב ממוקם פיזית בקווקז ובמזרח אירופה, הלקוח מקבל תמיד מידע מפורש על איזו מכונה ובאיזו סמכות שיפוט מתבצע העיבוד, וחוזרות רק תוצאות טקסטואליות/מובנות — לא קובצי המקור.

זה לא "לשלוח נתונים לענן". זו העברה ישירה למכשיר ספציפי ומוגדר, וחוזרים רק טקסטים ותוצאות מובנות — לא קובצי המקור, שכמובן לא אובדים, לא נמחקים ולא משתנים בשום צורה.

למה זה חשוב לכם

החיסכון קורה בשני מקומות בו-זמנית: הזמן שלכם (בלי מיון ידני), ותקציב החישוב של הרשת הנוירונית הבאה שתעבוד עם זה — היא מקבלת הקשר קומפקטי שכבר עובד, במקום מסה גולמית לא ממוינת.

כמה זה עולה ואיך העבודה מתנהלת

בחינם — רק ההערכה המקדימה. לפי תיאור הארכיון שלכם או צילום מסך של התיקייה, נאמר לכם אם באמת אפשר לסדר אותו וכמה זמן זה ייקח בערך. ההתקנה עצמה וההרצה על הארכיון שלכם הן השלב בתשלום — רישיון חד־פעמי לעיבוד מקומי, בלי הגבלה על נפח או על זמן. הסכום המדויק לארגונים נקבע בנפרד לכל מקרה.

מעבר לזה, אם הכוח שלכם לא מספיק. דרכון הארכיון שהתקבל בשלב הקודם הוא הבסיס להערכת התיאום הכבד יותר (מה שמעבד ללא כרטיס מסך לא מסוגל לעשות). המחיר נקבע לפי הנפח והסוג בפועל של הנתונים שנמצאו — היום אין מספר קבוע או תקרה; מנגנון החישוב עדיין לא נקבע. כאסמכתא, ראו את הנתונים למעלה בעמוד הזה: כמה הייתה עולה משימה דומה בשוק הענן הפתוח.

מה שנחוץ מכם. גישה לארכיון (דיסק, תיקייה, ייצוא) ותשובה לשאלה מה אתם רוצים לעשות איתו.

איך ההעברה מתבצעת בפועל. אצל ארגונים העיבוד כברירת מחדל לא יוצא כלל מהרשת המקומית שלכם. אם הכוח שלכם לא מספיק — מה שיוצא הוא לא הארכיון עצמו אלא ייצוא עבודה מצומצם שלו (דוגמה: מדיסק הקלטות וידאו של 2 טרהבייט — כ-2.7 ג'יגהבייט), ישירות למחשב אחד מוסכם, בלי ענן ציבורי באמצע.

אם משהו השתבש. חלון התמיכה לניסיון חוזר לאחר תקלה הוא 48–72 שעות מרגע הפנייה; הרצה חוזרת או עיבוד דיסק שני — הסכם נפרד.

עדיין לא מתואר באתר (מוגדר בנפרד לפי המצב שלכם): טופס הגדרת המשימה, דוגמת חוזה, לאן בדיוק מעלים את הנתונים, לוח הזמנים של העיבוד והתשלום, וקריטריוני הקבלה של התוצאה.

תרחישים לפי תעשייה ומשימה

נתוני לקוחות והיסטוריית אינטראקציה

מדיה, הפקה, סאונד

ארכיוני מסמכים מקצועיים

מוסדות ותשתיות מדיה

חינוך ופרקטיקה

איך זה עובד מבפנים

בכל מקום שבו אנשים מופיעים בחומר, נפתרת בנפרד השאלה מי בדיוק בקאדר: איך עובד זיהוי הפנים — עקרונות המודול והגבולות הכנים שלו.

תיאור כללי של המוצר ומבנה החברה — ב-digercules.com. לפניות שיתוף פעולה — ryazansky@gmail.com.