מקרה בוחן - בריאות

RAG קליני תואם HIPAA

ספק שירותי בריאות אזורי החליף חיפוש אקראי בהנחיות קליניות בעוזר מבוסס אחזור. קיצור של 42% בזמן עד לתשובה, אפס אירועי דליפת PHI, ומעבר ביקורת HIPAA בניסיון הראשון.

נקודת הפתיחה

ספק שירותי בריאות אזורי בארצות הברית, המפעיל כ-12 בתי חולים ומרפאות חוץ ומעסיק כ-2,800 רופאים. הנחיות קליניות פנימיות, מאגרי אינטראקציות בין תרופות ונהלים מוסדיים היו פזורים על פני מערכת SharePoint, שלושה אינטראנטים ישנים וספריית מידע קלינית של ספק חיצוני. רופאים נהגו לחפש בשתיים או שלוש מערכות כדי לענות על שאלה אחת, וזמן המענה הממוצע נמדד ב-4 עד 7 דקות לשאילתת נוהל - עומס קוגניטיבי שהצטבר לאורך המשמרת.

מנהל מערכות המידע ומנהל המידע הרפואי של הארגון רצו לבדוק אם עוזר AI מבוקר יכול להחליף חיפוש אקראי בממשק שאילתה אחד ומעוגן. האילוץ שלא היה נתון למשא ומתן היה HIPAA: שום מידע על מטופלים לא יגיע למודל השפה, שום PHI לא ייכנס ליומנים, ושום שירות SaaS של ספק לא יעבד את מאגר הידע ללא הסכם Business Associate המכסה אותו.

מה היה קשה כאן

אילוצי HIPAA על נתיב הנתונים

מאגר הידע הקליני עצמו אינו PHI, אבל שאילתות של רופאים כללו בפועל מזהים של מטופלים, כי השאלות היו ספציפיות למקרה. המערכת הייתה צריכה להשאיר את ה-PHI מחוץ להקשר של המודל לחלוטין, ועדיין להבין את כוונת השאלה הספציפית.

סף האמון של הרופאים

רופאים לא מאמצים עוזר AI שנותן תשובות שגויות בביטחון מלא, נקודה. ייחוס למקור וטיפול באי-ודאות היו חייבים להיות חלק ממבנה התשובה מלכתחילה, ולא תוספת מאוחרת.

מאגר הטרוגני

בסיס הידע לאחזור כלל קובצי PDF, דפי אינטראנט, מסמכי נהלים סרוקים ו-API קליני של צד שלישי. תדירות הרענון נעה בין יומית, במאגר אינטראקציות התרופות, לחודשית בנהלים המוסדיים.

איך יושמה המתודולוגיה

יושמה מתודולוגיית ארבעת השלבים של Slavin AI. משך ההתקשרות הכולל היה 14 שבועות לשלבים 1 עד 3, בתוספת ליווי שלב 4 עד סיום ההטמעה.

שלב 1 - גילוי (3 שבועות)

ההיקף צומצם לשאילתות נוהל שאינן דחופות, כלומר לא תמיכה בהחלטה קלינית בזמן אמת, שהייתה מסווגת כסיכון גבוה בכל פרשנות סבירה. קו הבסיס: זמן מענה ממוצע של 4 עד 7 דקות, שנמדד במדגם של 40 מפגשי צפייה בעבודת רופאים. סיווג סיכון: סיכון מוגבל לפי מסגרת EU AI Act, משום שלארגון יש גם מתקנים באירופה, ומפוקח תחת HIPAA בדין האמריקאי.

שלב 2 - ארכיטקטורה (4 שבועות)

אחזור מועשר (RAG) עם מאגר וקטורי פרטי המתארח בענן של הארגון עצמו. מודל השפה מתארח אצל ספק, אך תחת הסכם Business Associate המכסה את נתיב הנתונים. הסרת PHI מתבצעת בשער השאילתות: כל שאילתה שהכילה תבנית של מספר תיק רפואי, תאריך לידה, מספר זהות או שם מטופל נוקתה לפני שהגיעה למודל, כאשר המזהים שהוסרו נשמרו כאסימונים אטומים, כדי שרופא שירצה המשך טיפול ספציפי למקרה יקבל אותו בתהליך אנושי נפרד.

שלב 3 - תכנון ממשל (שבועיים, במקביל לשלב 2)

בסיס 12 הבקרות הותאם ל-HIPAA. בפועל: כל שאילתה, כל תשובה וכל מקור אחזור נרשמו במאגר יומנים כשיר ל-HIPAA, נפרד מיומני הייצור. החזרה לאחור הייתה דגל תצורה עם זמן הפעלה של 30 שניות. האחריות הוטלה על מנהל המידע הרפואי, עם מנהל אבטחת המידע כגורם הסלמה. הניטור כלל שיעור דחייה בביטחון נמוך, כאשר היעד היה מעל 5% בשאילתות מחוץ לתחום, כדי להוכיח שהמערכת מסרבת ולא ממציאה.

שלב 4 - ליווי ההטמעה (8 שבועות)

את הפיתוח הוביל צוות הפלטפורמה של הארגון, עם סקירות ארכיטקטורה שבועיות. נאכפו שתי בדיקות ממשל: אחת בשבוע 4, לאימות הנתונים והסרת ה-PHI, ואחת בשבוע 7, לאימות הניטור וההחזרה לאחור. אישור הבשלות לייצור ניתן בשבוע 8 עם שני סיכונים שנותרו ותועדו: קיבוע גרסת המודל אצל הספק, שלא תמך אז בגרסאות יציבות ומוזער באמצעות בדיקות רגרסיה שבועיות, והשהיית עדכון המאגר ב-API הקליני החיצוני, שהתקבלה כנמוכה מסף ההשפעה הקלינית.

מה השתנה, נמדד מול קו הבסיס

זמן עד לתשובה

קיצור של 42% בשאילתות נוהל, מקו בסיס של 4 עד 7 דקות לחציון של 2 עד 4 דקות. נמדד באותו פרוטוקול צפייה בעבודת 40 רופאים ששימש לקו הבסיס בשלב 1.

אירועי דליפת PHI

אפס אירועים ב-9 חודשי שימוש בייצור. שיעור ההסרה שנמדד בשער: כ-11% מהשאילתות הפעילו לפחות הסרה אחת, ונבדק שמדובר בסימן מובהק לרלוונטיות קלינית ולא בשיעור התרעות שווא שיש לדכא.

אימוץ בקרב רופאים

67% מהרופאים ביעד פעילים מדי חודש בתוך 90 יום מהשקת הפיילוט. אימוץ מרצון, לא בכפייה.

ביקורת HIPAA

עברה בניסיון הראשון. המבקר ציין במפורש את תיעוד שרשרת הנתונים וההחזרה לאחור כמופתי.

שיעור דחייה בביטחון נמוך

7% במצב יציב. מעל היעד של 5%, כלומר המערכת סירבה ולא המציאה תשובות במקרי קצה.

ציטוט מקורות

100% מהתשובות נשלחו עם מקור אחד לפחות שניתן לפתוח במאגר. דיוק הציטוט נבדק מדגמית ועמד על 96%.

מה היינו משנים

שיתוף רופאים מוקדם יותר בתכנון מערך ההערכה

מערך ההערכה של שלב 2 נשען על מערך זהב שנבנה בידי רופאים בשבוע השלישי של אותו שלב. בדיעבד, העבודה הזו הייתה צריכה להתחיל בשלב 1: מערך ההערכה היה התוצר היקר ביותר של שלב 2, ולחץ לוח הזמנים כיווץ את חלונות הבדיקה של הרופאים. בהתקשרויות הבאות, טיוטת מערך הזהב מתחילה כבר בשלב הגילוי.

קיבוע גרסת המודל היה צריך להיות דרישת סף

הספק לא תמך אז בגרסאות יציבות, וקיבלנו כפתרון ביניים בדיקות רגרסיה שבועיות. כעבור שלושה חודשים, עדכון מודל מצד הספק פגע בביצועים במחלקה מסוימת של שאילתות על אינטראקציות בין תרופות. הזיהוי התרחש בתוך 24 שעות בזכות מערך הרגרסיה, אך האירוע הוכיח שקיבוע הגרסה היה שווה מעבר לספק אחר.

סיפור רענון המאגר לא הוגדר דיו

תדירויות רענון יומיות, שבועיות וחודשיות ממקורות שונים יצרו מאגר וקטורי שהחזיר מדי פעם תוכן מעט מיושן. סף ההשפעה הקלינית לא נחצה, אבל תיעוד חלון ההתיישנות לכל מקור היה צריך להיות תוצר של שלב 3, ולא תוספת שנעשתה בדיעבד.

התקשרויות נוספות

שירותים פיננסיים - עוזר לקציני ציות

בית השקעות בינוני, עוזר AI לקציני ציות, פי 3.1 בתפוקת הבדיקה עם ייחוס מקורות ברמת ביקורת.

קראו את מקרה הבוחן

תעשייה - Document AI

יצרן תעשייתי אירופי, חילוץ מסמכי בקרת איכות של ספקים, 78% מעובדים אוטומטית מקצה לקצה, החזר השקעה בתוך 8 חודשים.

קראו את מקרה הבוחן

המתודולוגיה שבבסיס

מודל ההתקשרות בן ארבעת השלבים שהוביל את מקרה הבוחן הזה.

לעמוד המתודולוגיה

מתכננים יוזמת AI בתחום הבריאות?

סקירת ארכיטקטורה תזהה את רמת הפיקוח הרגולטורי, את החלטת הארכיטקטורה המסוכנת ביותר, ואם בכלל כדאי להתקדם מעבר לשלב הגילוי.