ספק שירותי בריאות אזורי בארצות הברית, המפעיל כ-12 בתי חולים ומרפאות חוץ ומעסיק כ-2,800 רופאים. הנחיות קליניות פנימיות, מאגרי אינטראקציות בין תרופות ונהלים מוסדיים היו פזורים על פני מערכת SharePoint, שלושה אינטראנטים ישנים וספריית מידע קלינית של ספק חיצוני. רופאים נהגו לחפש בשתיים או שלוש מערכות כדי לענות על שאלה אחת, וזמן המענה הממוצע נמדד ב-4 עד 7 דקות לשאילתת נוהל - עומס קוגניטיבי שהצטבר לאורך המשמרת.
מנהל מערכות המידע ומנהל המידע הרפואי של הארגון רצו לבדוק אם עוזר AI מבוקר יכול להחליף חיפוש אקראי בממשק שאילתה אחד ומעוגן. האילוץ שלא היה נתון למשא ומתן היה HIPAA: שום מידע על מטופלים לא יגיע למודל השפה, שום PHI לא ייכנס ליומנים, ושום שירות SaaS של ספק לא יעבד את מאגר הידע ללא הסכם Business Associate המכסה אותו.
מאגר הידע הקליני עצמו אינו PHI, אבל שאילתות של רופאים כללו בפועל מזהים של מטופלים, כי השאלות היו ספציפיות למקרה. המערכת הייתה צריכה להשאיר את ה-PHI מחוץ להקשר של המודל לחלוטין, ועדיין להבין את כוונת השאלה הספציפית.
רופאים לא מאמצים עוזר AI שנותן תשובות שגויות בביטחון מלא, נקודה. ייחוס למקור וטיפול באי-ודאות היו חייבים להיות חלק ממבנה התשובה מלכתחילה, ולא תוספת מאוחרת.
בסיס הידע לאחזור כלל קובצי PDF, דפי אינטראנט, מסמכי נהלים סרוקים ו-API קליני של צד שלישי. תדירות הרענון נעה בין יומית, במאגר אינטראקציות התרופות, לחודשית בנהלים המוסדיים.
יושמה מתודולוגיית ארבעת השלבים של Slavin AI. משך ההתקשרות הכולל היה 14 שבועות לשלבים 1 עד 3, בתוספת ליווי שלב 4 עד סיום ההטמעה.
ההיקף צומצם לשאילתות נוהל שאינן דחופות, כלומר לא תמיכה בהחלטה קלינית בזמן אמת, שהייתה מסווגת כסיכון גבוה בכל פרשנות סבירה. קו הבסיס: זמן מענה ממוצע של 4 עד 7 דקות, שנמדד במדגם של 40 מפגשי צפייה בעבודת רופאים. סיווג סיכון: סיכון מוגבל לפי מסגרת EU AI Act, משום שלארגון יש גם מתקנים באירופה, ומפוקח תחת HIPAA בדין האמריקאי.
אחזור מועשר (RAG) עם מאגר וקטורי פרטי המתארח בענן של הארגון עצמו. מודל השפה מתארח אצל ספק, אך תחת הסכם Business Associate המכסה את נתיב הנתונים. הסרת PHI מתבצעת בשער השאילתות: כל שאילתה שהכילה תבנית של מספר תיק רפואי, תאריך לידה, מספר זהות או שם מטופל נוקתה לפני שהגיעה למודל, כאשר המזהים שהוסרו נשמרו כאסימונים אטומים, כדי שרופא שירצה המשך טיפול ספציפי למקרה יקבל אותו בתהליך אנושי נפרד.
בסיס 12 הבקרות הותאם ל-HIPAA. בפועל: כל שאילתה, כל תשובה וכל מקור אחזור נרשמו במאגר יומנים כשיר ל-HIPAA, נפרד מיומני הייצור. החזרה לאחור הייתה דגל תצורה עם זמן הפעלה של 30 שניות. האחריות הוטלה על מנהל המידע הרפואי, עם מנהל אבטחת המידע כגורם הסלמה. הניטור כלל שיעור דחייה בביטחון נמוך, כאשר היעד היה מעל 5% בשאילתות מחוץ לתחום, כדי להוכיח שהמערכת מסרבת ולא ממציאה.
את הפיתוח הוביל צוות הפלטפורמה של הארגון, עם סקירות ארכיטקטורה שבועיות. נאכפו שתי בדיקות ממשל: אחת בשבוע 4, לאימות הנתונים והסרת ה-PHI, ואחת בשבוע 7, לאימות הניטור וההחזרה לאחור. אישור הבשלות לייצור ניתן בשבוע 8 עם שני סיכונים שנותרו ותועדו: קיבוע גרסת המודל אצל הספק, שלא תמך אז בגרסאות יציבות ומוזער באמצעות בדיקות רגרסיה שבועיות, והשהיית עדכון המאגר ב-API הקליני החיצוני, שהתקבלה כנמוכה מסף ההשפעה הקלינית.
קיצור של 42% בשאילתות נוהל, מקו בסיס של 4 עד 7 דקות לחציון של 2 עד 4 דקות. נמדד באותו פרוטוקול צפייה בעבודת 40 רופאים ששימש לקו הבסיס בשלב 1.
אפס אירועים ב-9 חודשי שימוש בייצור. שיעור ההסרה שנמדד בשער: כ-11% מהשאילתות הפעילו לפחות הסרה אחת, ונבדק שמדובר בסימן מובהק לרלוונטיות קלינית ולא בשיעור התרעות שווא שיש לדכא.
67% מהרופאים ביעד פעילים מדי חודש בתוך 90 יום מהשקת הפיילוט. אימוץ מרצון, לא בכפייה.
עברה בניסיון הראשון. המבקר ציין במפורש את תיעוד שרשרת הנתונים וההחזרה לאחור כמופתי.
7% במצב יציב. מעל היעד של 5%, כלומר המערכת סירבה ולא המציאה תשובות במקרי קצה.
100% מהתשובות נשלחו עם מקור אחד לפחות שניתן לפתוח במאגר. דיוק הציטוט נבדק מדגמית ועמד על 96%.
מערך ההערכה של שלב 2 נשען על מערך זהב שנבנה בידי רופאים בשבוע השלישי של אותו שלב. בדיעבד, העבודה הזו הייתה צריכה להתחיל בשלב 1: מערך ההערכה היה התוצר היקר ביותר של שלב 2, ולחץ לוח הזמנים כיווץ את חלונות הבדיקה של הרופאים. בהתקשרויות הבאות, טיוטת מערך הזהב מתחילה כבר בשלב הגילוי.
הספק לא תמך אז בגרסאות יציבות, וקיבלנו כפתרון ביניים בדיקות רגרסיה שבועיות. כעבור שלושה חודשים, עדכון מודל מצד הספק פגע בביצועים במחלקה מסוימת של שאילתות על אינטראקציות בין תרופות. הזיהוי התרחש בתוך 24 שעות בזכות מערך הרגרסיה, אך האירוע הוכיח שקיבוע הגרסה היה שווה מעבר לספק אחר.
תדירויות רענון יומיות, שבועיות וחודשיות ממקורות שונים יצרו מאגר וקטורי שהחזיר מדי פעם תוכן מעט מיושן. סף ההשפעה הקלינית לא נחצה, אבל תיעוד חלון ההתיישנות לכל מקור היה צריך להיות תוצר של שלב 3, ולא תוספת שנעשתה בדיעבד.
בית השקעות בינוני, עוזר AI לקציני ציות, פי 3.1 בתפוקת הבדיקה עם ייחוס מקורות ברמת ביקורת.
קראו את מקרה הבוחן
יצרן תעשייתי אירופי, חילוץ מסמכי בקרת איכות של ספקים, 78% מעובדים אוטומטית מקצה לקצה, החזר השקעה בתוך 8 חודשים.
מודל ההתקשרות בן ארבעת השלבים שהוביל את מקרה הבוחן הזה.
לעמוד המתודולוגיה
סקירת ארכיטקטורה תזהה את רמת הפיקוח הרגולטורי, את החלטת הארכיטקטורה המסוכנת ביותר, ואם בכלל כדאי להתקדם מעבר לשלב הגילוי.