זיהוי שפת סימנים רציף מרחבי-זמני באמצעות רשת קשובה מרובת תכונות(2)

Jun 01, 2023

3.5. למידת רצף

למידת רצף לאחר קבלת התוצאות ממחלץ התכונה המרחבית והזמנית בצורה של תכונת ברק, עלינו לסדר אותן למשפט שלם. לכן, עלינו להשתמש בלימוד רצף כדי להבטיח שהגלוס יצליח ליצור משפט טוב. השיטה הנפוצה ביותר במחקר הנוכחי מתייחסת לזיכרון דו כיווני ארוך טווח קצר (Bi-LSTM) ולסיווג זמני קונקציוניסטי (CTC) [17,23] עבור בעיות שניתן לפתור באמצעות CTC ומספר עבודות עדכניות [17,23] מציעות CTC כתהליך הדרכה מקצה לקצה עבור CSLR.

cistanche extract powder

אבקת תמצית Cistanche

לחץ כאן לצפייה במוצרי Cistanche

【בקש עוד】 דוא"ל:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

זיכרון לטווח קצר (LSTM) [44] הוא גרסה של הרשת העצבית החוזרת (RNN), והוא נמצא בשימוש נרחב במודלים של רצף. LSTM מדגמן מצוין תלות ארוכת טווח; הוא יכול לעבד רצפים שלמים של תשומות ולהשתמש במצב הפנימי שלהם כדי לדגמן את מעברי המצב. עם זאת, החיסרון של RNNs קדימה אלה הוא שהמצבים הנסתרים נלמדים רק מכיוון חד-כיווני. ה-RNN מייצר מצב נסתר כפי שמתואר במשוואה שלהלן לאחר קבלת רצף התכונות כקלט.

ht=RNN(ht−1,ot),

כאשר ht מייצג את המצב הנסתר, כאשר המצב ההתחלתי h0 הוא וקטור קבוע באפס, ו-t הוא שלב הזמן. RNN משמש כדי לחזות את הגהות הסימנים בהתאם לקלט רצף התכונות המרחביות.

יתר על כן, משימות SL הן די מורכבות. לכן, זה לא רק דורש תכונות המתקבלות מהקשר חד-כיווני אלא גם זקוק לסיוע בשימוש במידע דו-כיווני כדי ללמוד את התרחשותן של מילים שמגיעות לפני ואחרי המילים האחרות במשפט. כתוצאה מכך, אנו משתמשים ב-Bi-LSTM [45] כדי ללמוד את התלות הדינמית המורכבת של רצפי תמונה על ידי הפיכתם באמצעות ייצוגים מרחביים וזמניים לרצפים של תכונות מבריק. לפי ההסבר שצוין קודם לכן, שיטת Bi-LSTM יכולה לבצע עבודה דו כיוונית בשיטת LSTM. המשמעות היא ששיטת Bi-LSTM יכולה לסווג טוב יותר נתונים עוקבים. ניתן לראות את החישוב של Bi-LSTM המשתמש במצבים נסתרים דו-כיווניים גם כחישובים חוזרים ונשנים של ה-LSTM שמעובדים מלפנים לאחור ולאחר מכן מאחור לחזית. לאחר מכן, המצב הנסתר של כל שלב זמן מועבר דרך שכבה מחוברת לחלוטין ושכבת softmax [17].

cistanche powder

אבקת Cistanche

ב-= W(ht plus b),

yt,j=e at,j ∑ke at,j ,

כאשר b הוא וקטור הטיה ו-y(t,j) מייצג את ההסתברות לתווית j בשלב הזמן t. במשימת ה-TSL שלנו, התווית j היא אוצר המילים שמתקבל מהמשפט. בפועל, Bi-LSTM משפר משמעותית את כמות המידע שרשת יכולה לגשת אליה, מה שבתורו משפר את ההקשר של המידע הזמין באלגוריתם. המידע מכיל את הידע של איזו מילה באה אחרי או לפני המסגרת הנוכחית בקלט רצף תכונת המשפט.

Bi-LSTM שולח מצבים נסתרים כפלט לשכבת CTC עבור כל שלב זמן. מכיוון שהתוצאות של Bi-LSTM זה אינן שמות לב לסידור הברק, אנו משתמשים ב-CTC כדי לטפל במיפוי רצף וידאו o={ot} T 0 t=1 כדי לייצר סימן רצף ברק `={` i} IL =1 (L פחות או שווה ל-T) עם סידור טוב יותר. CTC משמש בתחומים רבים, כולל זיהוי כתב יד [46], זיהוי דיבור [47] וזיהוי שפת סימנים [17,23]. בתחום זה, הוא משמש כפונקציית ניקוד מבלי ליישר את רצפי הקלט והפלט. ב-CSLR, CTC ידוע כמודול שפותח עבור משימות מקצה לקצה הכוללות סיווג של נתונים זמניים ללא פילוח. באמצעות תכנות דינמי, CSLR יכול לפתור את בעיית היישור על ידי יצירת תווית ריקה (-) המאפשרת למערכת לייצר תוצאות אופטימליות לייצוג נתונים שאין להם תוויות (כגון נתוני epenthesis וקטעים של נתונים שאינם מחוות). בפרט, CTC יוצר תווית ריקה "-" כדי להרחיב את אוצר המילים V, כאשר V=Vorigin ∪ {-}. המטרה של תווית ריקה זו היא לייצג את המעבר ולהודיע ​​על קיומו של הגהה ריקה שאינה מספקת מידע לתהליך הלמידה, שכן π={πt} T 0 t{{20 }}, כאשר πt ∈ V. כתוצאה מכך, CTC יכול לנהל את פרמטרי הפלט ממחלץ התכונות המרחביות והזמניות וגם את Bi-LSTM כמודול היישור על ידי סיכום ההסתברויות של כל הנתיבים האפשריים. לכל נתיב היישור π יש הסתברות שניתנת לרצף הקלט באופן הבא [17]:

Cistanche deserticola experiment

ניסוי Cistanche deserticola

p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt

בשלב הבא, אנו מגדירים פעולת מיפוי רבים לאחד B, אשר מסירה כל רווח ריק ומשכפלת מילים מנתיב היישור. לדוגמה, B (II-am- -a- -doctor)=I, am, a, doctor. כתוצאה מכך, נוכל לחשב את ההסתברות המותנית של רצף הברק של הסימנים l כסך ההסתברויות של כל המסלולים שיכולים למפות ל-l מ-B, באופן המתואר להלן [17]:

p(π|o) = ∑ π∈B−1 p(π|o)

כאשר B −1 (l)={π|B(π)=l} היא הפעולה ההפוכה של B. לבסוף, הפסדי CTC של רצף התכונות מוגדרים באופן הבא [17]:

Lctc=− ln p(` |o)

ניתן לחשב את ההסתברות המותנית p(π|X) לפי הנחת העצמאות המותנית.

4. תוצאות ניסויים ודיון

cistanche—Improve memory2

תוסף Cistanche לידי-שיפור זיכרון

בחלק זה, נסביר את פרטי הניסוי שלנו עם התצורה המוצעת כפי שהוסבר בסעיף הקודם.

4.1. מערכי נתונים

בחלק זה, אנו מסבירים את מערכי הנתונים שבהם השתמשנו במהלך ניסוי זה. השתמשנו בשני מערכי נתונים, הראשון הוא מערך הנתונים של CSL [8,40,41] והשני הוא מערך הנתונים RWTH-PHOENIX [33,39]. שני מערכי הנתונים הללו הם מערכי נתונים רציפים של שפת סימנים, המשמשים לתרגום כמה סדרות של מחוות למשפט שלם.

4.1.1. ערכת נתונים של CSL

מערך הנתונים של CSL שימש על ידי מספר עבודות [8,40,41]. ישנם בסך הכל 100 משפטים ו-178 מילים במערך נתונים זה, המשמשים בדרך כלל בתקשורת יומיומית. מערך נתונים זה מכיל 5 מילים בממוצע למשפט. כל משפט בוצע על ידי 50 חותמים 5 פעמים. לפיכך, המספר הכולל של סרטונים הוא 25,000, מה שהופך את זה לאחד ממערכי הנתונים הגדולים ביותר. כדי לאמן את מודל ה-CSL שלנו, חילקנו את מערך הנתונים לנתונים לאימון עם 20,{11}} סרטונים ולבדיקה עם 5000 סרטונים מאותו משפט אבל עם חותמים שונים.

4.1.2. ערכת נתונים של RWTH-PHOENIX

מערך הנתונים RWTH-PHOENIX [33,39] הוא מערך שפת סימנים גרמני, שהוא הקלטה של ​​שידורי מזג אוויר פומביים מתחנות טלוויזיה בגרמניה. סרטון זה מעובד כך שיש לו גודל של 210 × 260. ישנם 6841 משפטים שונים החתומים על ידי 9 חותמים שונים. כל החותמים לבשו בגדים כהים על רקע בהיר. בסך הכל, יש 1232 מילים עם כ-80,{11}} הגהות. מערך הנתונים הזה מחולק לפי פורמט קבוע מראש, המורכב מ-5672 דגימות אימון, 540 דגימות אימות/פיתוח ו-629 דגימות בדיקה.

4.2. עיבוד מוקדם של נתונים

הדבר הראשון שהיינו צריכים לעשות היה לעבד מראש את מערך הנתונים שלנו כך שיתאים למודל המוצע שלנו. ביצענו שינוי גודל וחיתוך, כפי שמתואר באיור 3; בצד שמאל, אנו יכולים לראות שהנתונים המקוריים היו בגודל של Full HD או רזולוציה של 1920 × 1080. היינו צריכים לחתוך ולשנות את גודלו לרזולוציה של 224 × 224 מכיוון שהמודול המרחבי שלנו מקבל קלט בגודל זהה לקלט ResNet50. לאחר מכן, הכנסנו את הנתונים למודל המרחבי שלנו, שיפיק את הטנזור 7×7 מתמונה אחת.

לאחר מכן נעשה שימוש בתמונה המלאה המעובדת מראש ליצירת תכונות נקודת המפתח. השתמשנו במודל HRNet כדי לחזות את 133 נקודות המפתח מתמונות RGB אלה. עם זאת, אנו משתמשים רק ב-27 נקודות מפתח של פלג הגוף העליון במודל המוצע שלנו. גודל הקלט עבור תכונות נקודת המפתח הוא 27 × 3 מכיוון שיש לנו נתוני קואורדינטות של 3-ציר (x, y ו-z) לכל נקודה. ממד הקלט של הדגם הוא N × 224 × 224 × 3 עבור תכונת המסגרת המלאה ו-N × 1 × 27 × 3 עבור קלט נקודת המפתח, כאשר N הוא מספר הפריימים. כדי לשפר את הווריאציה של מערך הנתונים, אנו עוקבים אחר ההגדלה מ-[12], כולל חיתוך אקראי, היפוך אופקי ושינוי קנה מידה זמני אקראי. חיתוך אקראי משמש גם כחלק משלב עיבוד מקדים לחיתוך התמונה המקורית.

cistanche—Improve memory7

תוסף Cistanche לידי-שיפור זיכרון

4.3. מדד הערכה

כדי להעריך את ביצועי הזיהוי של המודל המוצע שלנו, אנו משתמשים במדד שיעור שגיאות מילים (WER), שהוא מדד נפוץ ב-CSLR כדי להעריך את דיוק הזיהוי של משפט חזוי, כפי שמוצג במשוואה שלהלן [17]:

WER=S פלוס I פלוס DT=S פלוס I פלוס DS פלוס C פלוס D

כאשר S הוא מספר ההחלפות של המילה המקורית, I הוא מספר ההוספות שאינן במשפט המקורי, D הוא מספר המחיקות שהיו אמורות להיות במשפט המקורי, C הוא מספר המילים הנכונות שתואמות המשפט המקורי, ו-T הוא המספר הכולל של מילים במשפט או שניתן לקבל מתוך סך ההחלפות, המחיקות והמילים הנכונות. עבור CSL, כל תו משמש לייצוג מילה.

4.4. ניסוי בזרמי קלט

ניסוי זה מתמקד בעיקר בהשוואת קלט זרם יחיד ורב זרם במודל שלנו. המטרה היא למצוא את התצורה הטובה ביותר של זרם הקלט. אנו משתמשים רק במערך הנתונים של RWTH-PHOENIX בניסוי זה. הדגם שלנו יקבל שתי כניסות נפרדות, קלט מלא ונקודת מפתח. קלט הזרם היחיד משתמש רק בתכונת ה-RGB מהתמונה המלאה. ישנם שני ניסויי קלט בזרם יחיד. הראשון משתמש רק בתכונת המסגרת המלאה מתמונת ה-RGB, והשני משתמש בתכונות נקודת המפתח מהקלט של נקודת המפתח. הקלט הרב-זרם שאנו מציעים מורכב מתכונות RGB ו-keypoint. תוצאת ההשוואה באמצעות זרם יחיד ורב זרם מוצגת בטבלה 1. כאן, אנו יכולים לראות שבאמצעות תכונת ריבוי הזרמים נוכל להשיג תוצאה טובה יותר מאשר באמצעות זרם יחיד. המיינסטרים מתקבל מתכונת RGB של מסגרת מלאה והזרם הנוסף משתמש בתכונות המפתח. זרם נקודות המפתח הנוסף עוזר לדגם ללמוד טוב יותר, במיוחד כדי ללכוד את הפרטים של צורת היד.

טבלה 1. השוואת ביצועים של WER באמצעות זרם יחיד וקלט מרובה זרם.

Table 1. WER Performance comparison using single stream and multi-stream input.


4.5. ניסוי על מודול הקשב

מטרת הניסוי הייתה לבחור את התצורה הטובה ביותר של מודול הקשב. בניסוי זה, אנו משתמשים בתצורה של התוצאה הטובה ביותר מתוצאת הניסוי הקודמת ובאותו מערך נתונים. אנו מציינים את הקשב המרחבי כמודל עם שכבת תשומת לב עצמית בסוף המודול המרחבי עבור כל תכונה. קשב זמני מוקדם הוא שכבת הקשב העצמי לאחר האיגום הזמני הראשון, וקשב הזמן המאוחר הוא שכבת הקשב העצמי לאחר האיגום הזמני השני. כאן נשווה את כל התצורות לעיל ואת השילוב של תשומת לב מרחבית וזמנית. התוצאה מוצגת בטבלה 2. התוצאה של קשב מרחבי גרועה מתשומת לב זמנית. הרמה המרחבית מכילה רצף של תכונות עבור כל פריים. כפי שהוזכר ב-[20], קל יותר ללמוד את שכבת הקשב העצמית את הדרך הקצרה יותר בין תלות ארוכה. לכן, הקשב המרחבי לא מצליח להפחית את ה-WER בגלל הרצף הארוך. מצד שני, הצלחנו להשיג תוצאה משופרת באמצעות תשומת לב זמנית על ידי הצבתו לאחר ה-pooling כך שהוא יקבל אורך רצף קצר יותר. הקשב המאוחר בעל אורך הרצף הקצר ביותר משיג את התוצאה הטובה ביותר. יתרה מכך, השילוב של מודול הקשב במרחב וזמני גרוע יותר משימוש בקשב בודד בלבד. בהתבסס על תוצאות אלה, אנו מיישמים את התצורה הטובה ביותר עבור הניסויים והלאה.

טבלה 2. השוואת ביצועים של WER באמצעות תצורת קשב שונה

Table 2. WER Performance comparison using different attention configuration


4.6. ניסוי אבלציה ברשת STAMF

יתר על כן, אנו מבצעים ניסוי אבלציה תוך שימוש באותו מערך נתונים ובתצורה הטובה ביותר של זרם הקלט ומודול הקשב. טבלה 3 על ניסוי המשתמש בקשב זמני מאוחר ללא איגום מוכיחה שאורך הרצף משפיע על ביצועי הקשב. הניסויים המשתמשים בשכבות איגום עם אורכי רצף קצרים יותר משיגים תוצאות טובות יותר. אנו גם מבצעים ניסוי אבלציה כדי לדעת את הביצועים באמצעות מודלים שונים ללמידת רצף. התוצאה בטבלה 4 מראה ששימוש ב-LSTM, בעל מידע חד-כיווני בלבד, הוא בעל ביצועים נמוכים יותר מאשר בשימוש ב-Bi-LSTM, בעל מידע דו-כיווני.

טבלה 3. השוואת ביצועים של WER באמצעות תצורות שונות של קשב זמני מאוחר.

Table 3. WER Performance comparison using different late temporal attention configurations.

טבלה 4. השוואת ביצועים של WER באמצעות תצורת למידה שונה ברצף.

Table 4. WER Performance comparison using different sequence learning confifiguration.


4.7. ניסוי ברשת STAMF

בסעיף זה, אנו מסבירים את תהליך ההכשרה המלא עבור המודל המוצע שלנו הנקרא spatiotemporal attentive multi-feature (STAMF). זה יכסה את האופן שבו אנו מתאימים את נתוני הקלט שלנו למודול המרחבי, המודול הזמני ומודול למידת הרצף צעד אחר צעד. בסעיף זה, אנו משתמשים בקלט מרובה זרם ובתצורת קשב זמני מאוחר.

4.7.1. פרטי יישום

אנו מבצעים אימון ובדיקות מקצה לקצה באמצעות מסגרות קלט בגדלים של 224 × 224. עבור האופטימיזר, אנו משתמשים ב-Adam Optimizer עם 10−4 כקצב הלמידה ומחלקים אותו ב-2 בתקופות 10 ו-15 עבור CSL ו עידנים 30, 40 ו-60 עבור RWTH PHOENIX. אנו מגדירים את גודל האצווה ל-4 ומבצעים 80 עידנים עבור RWTH-PHOENIX ו-20 עידנים עבור CSL. ההדרכה והבדיקות בוצעו על NVIDIA Tesla V100 ו-128G RAM.

בהתחלה חילצנו את התכונה מזרמי RGB באמצעות ResNet50 והשתמשנו ב-HRNet כדי להשיג את נקודת המפתח ולאחר מכן לחלץ את תכונות המפתח באמצעות ResNet50. שימו לב שעסקנו בנתונים עוקבים או בסרטון. לפיכך, היינו צריכים להגדיר את גודל הקלט שלנו בהתאם לאורך הסרטון. מסיבות טכניות, גודל הקלט עבור כל הנתונים צריך להיות זהה זה לזה. לכן, עלינו לדעת את הסרטון הארוך ביותר במערך הנתונים שלנו, ולאחר מכן ריפדנו את אורך מסגרת הקלט שלנו כך שיתאים למספר המסגרת הגדול ביותר

התכונות שחולצו ברצף שימשו את המודול הזמני. כל זרם רציף עבר שני אגורים זמניים מוערמים. כל איגום זמני היה מורכב מרשת קונבולוציונית 1-ממדית ושכבת איסוף מקסימלית, שהקטינה את אורך הרצף בחצי. הפלט של האיגום הזמני משני הזרמים חובר לאחר מכן לשכבת הקשב ועבור האיגום הזמני האחרון, לאחר שכבת הקשב, הוא שרשר בסופו כפלט המודול הזמני.

הפלט הזמני עובד על ידי מודול למידת הרצף. התהליך השתמש בשכבת Bi-LSTM המחוברת ל-CTC כדי לקבל את היישור הסופי ולחבר את הברק למשפט אחרון.

4.7.2. תוצאה כמותית

המשפטים האחרונים הושוו עם האמת הבסיסית כדי לחשב את ציון ה-WER כתוצאה כמותית. עבור ה-CSL אנו מחלקים את מערך הנתונים ל-80 אחוזים עבור נתוני ההדרכה ו-20 אחוזים עבור נתוני הבדיקה. כפי שמוצג בטבלה 5, המודל המוצע שלנו עם ריבוי תכונות (STMF) באמצעות תכונות המסגרת המלאה ונקודות המפתח יכול להשיג תוצאה טובה יותר ולהפחית את ה-WER ל-0.8 בהשוואה לדגם המשתמש רק בתכונת המסגרת המלאה [23]. התוצאה הטובה ביותר שלנו הושגה על ידי המודל הרב-תכונות המוצע באמצעות מנגנון הקשב (STAMF), שהשיג 0.7 עבור ה-WER. שכבת הקשב עדיין שיפרה מעט את התוצאה למרות שלמערך הנתונים של CSL לא היו מסגרות פגומות. זה מוכיח שלרובד הקשב יש השפעה על הדגם. מודל ריבוי התכונות המוצע עצמו עדיף על השיטות המתקדמות ושכבת הקשב תורמת להפחתת ציון ה-WER במערך הנתונים של CSL. נקודת המפתח ב-CSL נותנת השפעה משמעותית מכיוון שהיא יכולה לתת מידע יעיל בהשוואה לשיטת ריבוי התכונות האחרת [17] שמשתמשת בתנוחת ידיים, פנים וגוף.

עבור מערך הנתונים RWTH-PHOENIX, השתמשנו בתצורה המלאכותית כדי לפצל את נתוני ההדרכה והבדיקה. מערך הנתונים חולק ל-5672 סרטונים לדוגמה להדרכה, 540 סרטונים לדוגמה לאימות עצמי ו-629 סרטונים לדוגמה לבדיקה. כפי שמוצג בטבלה 6, התוצאה המוצעת שלנו למודל מרובה תכונות (STMF) תוך שימוש בתכונות המסגרת המלאה ונקודות המפתח הייתה 24 אחוז WER, והתוצאה הטובה ביותר שלנו הייתה 20.5 אחוז, שהושגה על ידי המודל המוצע באמצעות מודול הקשב (STAMF) בתוצאת האימון. תוצאות הבדיקה הן השניות הטובות ביותר בהשוואה ל-[17] מכיוון שהן משתמשות ביותר תכונות כקלט. עם זאת, מודול הקשב הוכיח תרומה משמעותית להפחתת ציון ה-WER עבור מערך הנתונים RWTHPHOENIX. בשונה מהתוצאה שלנו עבור מערך הנתונים של CSL, המודל המוצע שלנו עם ריבוי זרמים לא השיג תוצאה אופטימלית. הסיבה לכך היא שלמערך הנתונים RWTH-PHOENIX יש הרבה מסגרות פגומות; יש להם חלק מטושטש, במיוחד באזור הידיים. מסגרת זו נותנת מידע נקודת מפתח לא עקבי עקב מיקום נקודת מפתח חסר או שגוי והופכת את הדגם לפחות אופטימלי. בעיה זו מטופלת על ידי הוספת שכבת הקשב למודל המוצע של ריבוי תכונות, מה שעוזר בבחירת המידע הנכון ומביא לשיפור משמעותי בהשוואה למודל הרב-תכונות המוצע ללא תשומת לב.

טבלה 5. השוואת ביצועים של WER במערך הנתונים של CSL.

Table 5. WER Performance comparison on the CSL dataset.

טבלה 6. השוואת ביצועים של WER במערך הנתונים RWTH-PHOENIX.

Table 6. WER Performance comparison on the RWTH-PHOENIX dataset.


4.7.3. תוצאה איכותית

ביצענו גם הערכה איכותית של המודל שלנו, תוך שימוש בהדמיה של תוצאת הזיהוי. איור 8 מציג את הפרטים של ההערכה האיכותית שלנו באמצעות שלוש דוגמאות של משפטים. המשפט הראשון מורכב מ-10 מילים ומספר המסגרות הכולל הוא 220. המשפט השני מורכב מ-12 מילים ומספר המסגרות הכולל הוא 168. המשפט השלישי מורכב מ-9 מילים ומספר המסגרות הכולל הוא 135.

תוצאת הדוגמא מראה שחלק מהגהות אינן חזויות נכון על ידי המודלים, ואנו מציינים זאת בסימן האדום. עם זאת, הוא עדיין יכול לחזות את רוב המילים הנכונות. המספר הגדול ביותר של שגיאות נמצא במשפט הראשון, בעל מספר המסגרת הארוך ביותר. במשפט זה, בתחילת המשפט יש יותר שגיאות, בגלל שמספר מחוות למילים המוקדמות שונות רק מעט ולכן קשה להבחין בין הגבולות. עם זאת, המודל המוצע עם ריבוי תכונות ותשומת לב (STAMF) יכול לזהות מילים נוספות, אך הן סומנו לא נכון. יתרה מכך, תצורת המודל עם תשומת לב משיגה תוצאת זיהוי טובה יותר עבור שתי דגימות נוספות, בהשוואה למודל המוצע ללא תשומת לב.

Figure 8.


איור 8. הערכה איכותית של תוצאת הזיהוי באמצעות תצורה שונה של מערך הנתונים RWTH-PHOENIX [33,39]. ההגהות החזויות השגויות מסומנות באדום.

5. מסקנות

במאמר זה, אנו מציגים מאפיין מרחבי-זמני חדשני (STAMF) עבור CSLR, שמטרתו ללמוד מתאמים מרחביים-זמניים ואת המידע החשוב מרצף התכונות החזותיות ותכונות המפתח בגישה מקצה לקצה. במסגרת שלנו פותח מודול מרחבי עם תכונה של מסגרת מלאה מנתוני RGB ונקודות מפתח מנקודות המפתח של הגוף, כולל הידיים כריבוי תכונות. שילובים אלה ששימשו כקלט תכונות מרובה זרם נתנו ביצועים מעולים בהשוואה לגישה המתקדמת המשתמשת רק במסך מלא או בהשוואה לשיטה איור 8. הערכה איכותית של תוצאת הזיהוי באמצעות תצורה שונה של ה-RWTH -PHOENIX מערך נתונים [33,39]. ההגהות החזויות השגויות מסומנות באדום. 5. מסקנות במאמר זה, אנו מציגים STAMF חדשנית קשובה מרחבית-זמנית (STAMF) עבור CSLR, שמטרתה ללמוד מתאמים מרחביים-זמניים ואת המידע החשוב מרצף התכונות החזותיות ותכונות נקודת המפתח בקצה-ל- גישת סוף. במסגרת שלנו פותח מודול מרחבי עם תכונה של מסגרת מלאה מנתוני RGB ונקודות מפתח מנקודות המפתח של הגוף, כולל הידיים כריבוי תכונות. שילובים אלו המשמשים כקלט תכונות מרובה זרם העניקו ביצועים מעולים בהשוואה לגישה המתקדמת המשתמשת רק במסך מלא או בהשוואה לשיטה המשתמשת בשילוב ריבוי תכונות אחר, במיוחד עבור מערך הנתונים של CSL. לאחר מכן, אנו מציעים מודול זמני המורכב מאיגום זמני ותשומת לב זמנית כדי ללכוד את המידע החשוב בתחום הזמני. התוספת של קשב זמני מאוחר מסוגלת להשיג את התכונה החשובה מהרצף שיש בה מידע שגוי ונותנת שיפור משמעותי בהשוואה למודל הרב-התכונות המוצע שלנו. זה גם עוזר ללמידה ברצף ללמוד טוב יותר ומשפר את הביצועים כמו בניסוי של מערך הנתונים של CSL. ניסויים נרחבים על מערכי נתונים נפוצים מוכיחים את העליונות של המודל המוצע שלנו על המודל החדיש ביותר, כאשר ציוני WER יורדים ביותר מ-50 אחוז עבור מערך הנתונים של CSL ויורד ב-5 אחוז עבור מערך הנתונים RWTH-PHOENIX. בעתיד, אנו מתכננים ליישם את טכניקת למידת ההעברה עם המודל הנוכחי שלנו וכן ליישם את העבודה השוטפת שלנו בתעשייה אמיתית.

הפניות

1. Dreuw, P.; ריבך, ד.; Deselaers, T.; זהדי, מ.; Ney, H. טכניקות זיהוי דיבור למערכת לזיהוי שפת סימנים. בהליכי INTERSPEECH 2007, הכנס השנתי השמיני של האגודה הבינלאומית לתקשורת דיבור, אנטוורפן, בלגיה, 27–31 באוגוסט 2007; עמ' 2513–2516.

2. אונג, SCW; Ranganath, S. ניתוח אוטומטי של שפת הסימנים: סקר והעתיד מעבר למשמעות המילונית. IEEE טרנס. דפוס אנאלי. מאך. אינטל. 2005, 27, 873–891. [CrossRef] [PubMed]

3. ווגלר, סי; Metaxas, D. מסגרת לזיהוי ההיבטים הבו-זמניים של שפת הסימנים האמריקאית. מחשוב. Vis. Image Underst. 2001, 81, 358–384. [CrossRef]

4. בודן, ר.; Windridge, D.; כדיר, ת.; זיסרמן, א.; Brady, M. וקטור תכונה לשונית לפרשנות החזותית של שפת הסימנים. בהליכי הוועידה האירופית לראייה ממוחשבת (ECCV), פראג, צ'כיה, 11–14 במאי 2004; עמ' 390–401.

5. קאסוקורתי, נ.; רוקאד, ב.; בידאני, ש.; Dennisan, DA זיהוי אלפבית בשפת הסימנים האמריקאית באמצעות למידה עמוקה. arXiv 2019, arXiv:1905.05487.

6. קולר, או.; זרגראן, ש.; ניי, ח.; Bowden, R. Deep Sign: Enabling Robust Statistical Continuous Sign Language Recognition via Hybrid CNN-HMMs. Int. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]

7. פו, ג'; ג'ואו, ו.; Li, H. Dilated Convolutional Network עם אופטימיזציה איטרטיבית לזיהוי מתמשך של שפת הסימנים. בהליכי הכנס הבינלאומי העשרים ושבע על בינה מלאכותית, שטוקהולם, שוודיה, 13-19 ביולי 2018; עמ' 885–891.

8. פו, ג'; ג'ואו, ו.; Li, H. Iterative Alignment Network לזיהוי מתמשך של שפת הסימנים. בהליכי כנס IEEE Computer Society on Computer Vision and Pattern Recognition, Long Beach, CA, ארה"ב, 15-20 ביוני 2019; עמ' 4160–4169.

9. Kumar, N. מעקב אחר פנים וידיים אנושיות מבוסס מסלול תנועה לזיהוי שפת הסימנים. בהליכים של 2017 4הכנס הבינלאומי של IEEE Uttar Pradesh Section on Electrical, Computer and Electronics, Mathura, הודו, 26–28 באוקטובר 2017; עמ' 211–216.

10. בהויאן, חבר כנסת; Ghoah, D.; Bora, PK מסגרת לזיהוי מחוות ידיים עם יישומים לשפת הסימנים. בהליכי ועידת הודו השנתית 2006, INDICON, ניו דלהי, הודו, 15-17 בספטמבר 2006; עמ' 1–6.

11. דאס, SP; Talukdar, AK; Sarma, KK זיהוי שפת הסימנים באמצעות הבעת פנים. ב-Proceedings of the Procedia Computer Science, קראלה, הודו, 10–13 באוגוסט 2015; עמ' 210–216.

12. Rastgoo, R.; קיאני, ק.; Escalera, S.; Sabokrou, M. הפקת שפת הסימנים: סקירה. בהליכי כנס IEEE/CVF לשנת 2021 בנושא ראייה ממוחשבת וסדנאות לזיהוי דפוסים (CVPRW), נאשוויל, TN, ארה"ב, 19-25 ביוני 2021; עמ' 3446–3456.

13. דונג, ש.; וואנג, פ.; עבאס, ק. סקר על למידה עמוקה ויישומיה. מחשוב. Sci. Rev. 2021, 40, 100379. [Cross Ref]

14. Athitsos, V.; ניידל, סי; סקארוף, ש.; נאש, ג'; סטפן, א.; יואן, ש; Thangali, A. מערך הנתונים של לקסיקון שפת הסימנים האמריקאי. בהליכי כנס 2008 IEEE Computer Society בנושא ראייה ממוחשבת וסדנאות זיהוי דפוסים, סדנאות CVPR, Anchorage, אלסקה, 23-28 ביוני 2008; עמ' 1–8.

15. בונגרות', ג'; שטיין, ד.; Dreuw, P.; ניי, ח.; מוריסי, ש.; דרך, א.; Zijl, LV קורפוס שפת הסימנים של ATIS. ב-Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, מרקש, מרוקו, 28–30 במאי 2008; עמ' 2943–2946.

16. Papastratis, I.; Chatzikonstantinou, C.; קונסטנטידיס, ד.; דימיטרופולוס, ק.; Daras, P. טכנולוגיות בינה מלאכותית לשפת הסימנים. חיישנים 2021, 21, 5843. [CrossRef] [PubMed]

17. ג'ואו, ה.; ג'ואו, ו.; ג'ואו, י.; Li, H. רשת מרובת סימנים מרחבית-זמנית לזיהוי רציף של שפת הסימנים. בהליכי AAAI 2020 - ועידת AAAI שלושים וארבעה לבינה מלאכותית, ניו יורק, ניו יורק, ארה"ב, 7-12 בפברואר 2020; עמ' 13009–13016.

18. Gündüz, C.; Polat, H. זיהוי שפת הסימנים הטורקית המבוססת על היתוך נתונים רב-זרמים. טורקית J. Electr. Eng. מחשוב. Sci. 2021, 29, 1171–1186. [CrossRef]

19. בוהצ'ק, מ.; Hruz, M. Sign Pose-based Transformer לזיהוי שפת סימנים ברמת מילים. בהליכים של כנס 2022 IEEE/CVF Winter on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, ארה"ב, 4-8 בינואר 2022; עמ' 182–191.

20. Vaswani, A. Attention Is All You Need. בהליכי הכנס על מערכות עיבוד מידע עצבי, לונג ביץ', קליפורניה, ארה"ב, 4-9 בדצמבר 2017; עמ' 1–11.

21. ג'ואו, מ.; נג, מ.; קאי, ז; Cheung, KC רשתות מבוססות תשומת לב עצמית לזיהוי מתמשך של שפת הסימנים. חֲזִית. Artif. אינטל. יישום 2020, 325, 2832–2839.

22. Camgöz, NC; קולר, או.; הדפילד, ש.; Bowden, R. Transformers Language Languages: זיהוי ותרגום משותף של שפת סימנים מקצה לקצה. בהליכי כנס IEEE Computer Society on Computer Vision and Pattern Recognition, סיאטל, WA, ארה"ב, 14-19 ביוני 2020; עמ' 10020–10030.

23. דקה, י.; האו, א.; חי, X.; Chen, X. אילוץ יישור חזותי לזיהוי מתמשך של שפת הסימנים. בהליכי כנס IEEE הבינלאומי לראייה ממוחשבת (ICCV), מונטריאול, BC, קנדה, 10-17 באוקטובר 2021; עמ' 11542–11551.

24. גואו, ד.; ג'ואו, ו.; וואנג, מ.; Li, H. זיהוי שפת הסימנים מבוסס על HMMs אדפטיביים עם הגדלת נתונים. בהליכי כנס IEEE הבינלאומי לעיבוד תמונה (ICIP), Phoenix, AZ, ארה"ב, 25-28 בספטמבר 2016; עמ' 2876–2880.

25. Huang, J.; ג'ואו, ו.; לי, ה.; Li, W. זיהוי שפת הסימנים באמצעות 3D Convolutional Neural Networks. בהליכי כנס IEEE הבינלאומי למולטימדיה ואקספו (ICME), טורינו, איטליה, 29 ביוני-3 ביולי 2015; עמ' 1–6.

26. גואו, ד.; ג'ואו, ו.; לי, ה.; Wang, M. היתוך מקוון מוקדם-מאוחר מבוסס על HMM אדפטיבי לזיהוי שפת הסימנים. ACM Trans. מולטימד. מחשוב. Commun. יישום 2017, 14, 1–18. [CrossRef]

27. אלחמאדי, מ.; מוחמד, ג.; חבר, S. זיהוי מחוות יד לשפת הסימנים באמצעות 3DCNN. IEEE Access 2020, 8, 79491–79509. [CrossRef]

28. רזא, ח.; Joze, V. MS-ASL: מערך נתונים ובנצ'מרק בקנה מידה גדול להבנת שפת הסימנים האמריקאית. arXiv 2019, arXiv:1812.01053.

29. לי, ד.; Opazo, CR; יו, X.; Li, H. זיהוי שפת סימנים עמוקה ברמת מילים מווידאו: מערך נתונים ושיטות חדש בקנה מידה גדול. בהליכים של כנס 2020 IEEE Winter on Applications of Computer Vision, WACV, Snowmass Village, CO, ארה"ב, 1-5 במרץ 2020; עמ' 1448–1458.

30. פו, י.; ג'ואו, ו.; Li, H. זיהוי שפת הסימנים עם תכונות רב-מודאליות. ב-Proceedings of the Pacific Rim Conference on Multimedia, שיאן, סין, 15–16 בספטמבר 2016; עמ' 252–261.

31. Jiang, S.; שמש, ב.; וואנג, ל.; באי, י.; לי, ק.; Fu, Y. Skeleton Aware Multi-modal Language Recognition. בהליכי כנס IEEE Computer Society בנושא ראייה ממוחשבת וסדנאות לזיהוי דפוסים, נאשוויל, TN, ארה"ב, 19-25 ביוני 2021; עמ' 3408–3418.

32. סידיג, א.א.י.; לוקמן, ח.; מחמוד, ש.; Mohandes, M. KArSL: מאגר שפת הסימנים הערבית. ACM Trans. אסייתי בעל משאבים נמוכים. לאנג. אינפ. עיבוד 2021, 20, 1–19. [CrossRef]

33. קולר, או.; פרסטר, ג'; Ney, H. זיהוי מתמשך בשפת הסימנים: לקראת אוצר מילים גדול מערכות זיהוי סטטיסטי המטפלות במספר חותמים. מחשוב. Vis. Image Underst. 2015, 141, 108–125. [CrossRef]

34. קולר, או.; קמגוז, צפון קרוליינה; Ney, H. למידה בפיקוח חלש עם Multi-Stream CNN-LSTM-HMMs לגילוי מקביליות רציפה בסרטוני שפת סימנים. IEEE טרנס. דפוס אנאלי. מאך. אינטל. 2020, 42, 2306–2320. [CrossRef] [PubMed]

35. קמגוז, צפון קרוליינה; הדפילד, ש.; קולר, או.; Bowden, R. SubUNets: צורת יד מקצה לקצה וזיהוי שפת סימנים מתמשך. בהליכי כנס 2017 IEEE הבינלאומי לראייה ממוחשבת (ICCV), ונציה, איטליה, 22-29 באוקטובר 2017; עמ' 3075–3084.

36. דונג, סי; לוי, CC; הוא, ק.; Tang, X. רזולוציית-על של תמונה באמצעות רשתות קונבולוציוניות עמוקות. IEEE טרנס. דפוס אנאלי. מאך. אינטל. 2014, 38, 295–307. [CrossRef] [PubMed]

37. ברסם, ק"ק; אדמס, LC; ארקסלבן, סי; חמם, ב.; Niehues, SM; Vahldiek, JL השוואת ארכיטקטורות שונות של למידה עמוקה לסיווג צילומי חזה. Sci. Rep. 2020, 10, 13590. [CrossRef]

38. שמש, ק.; שיאו, ב.; ליו, ד.; Wang, J. למידה עמוקה של ייצוג ברזולוציה גבוהה להערכת תנוחות אנושיות. בהליכי כנס IEEE Computer Society on Computer Vision and Pattern Recognition, Long Beach, CA, ארה"ב, 15-20 ביוני 2019; עמ' 5686–5696.

39. קולר, או.; זרגראן, ש.; Ney, H. Re-Sign: יישור מחדש של מודלים מקצה לקצה עם רכיבי CNN-HMM חוזרים עמוקים. לקראת ועידת IEEE 2017 בנושא ראייה ממוחשבת וזיהוי דפוסים (CVPR), Honululu, HI, ארה"ב, 21–26 ביולי 2017; עמ' 3416–3424.

40. ג'ואו, ה.; ג'ואו, ו.; Li, H. פענוח תווית פסאודו דינמי לזיהוי רציף של שפת הסימנים. בהליכי כנס 2019 IEEE International on Multimedia and Expo (ICME), שנחאי, סין, 18–21 ביולי 2019; עמ' 1282–1287.

41. שיאו, ש.; צ'אנג, X.; ג'אנג, X.; Liu, X. זיהוי שפת סימנים מבוסס וידאו ללא פילוח זמני. בהליכי ועידת AAAI שלושים ושתיים בנושא בינה מלאכותית, ניו אורלינס, לוס אנג'לס, ארה"ב, 2-7 בפברואר 2018; עמ' 2257–2264.

42. גרייבס, א.; פרננדס, ש.; גומז, פ.; Schmidhuber, J. Connectionist Temporal Classification: תיוג נתוני רצף לא מפולחים עם רשתות עצביות חוזרות. ב-Proceedings of the ICML '06: Proceedings of the 23rd International Conference on Machine learning, Pittsburgh, PA, USA, 25–29 יוני 2006; עמ' 369–376.

43. גרייבס, א.; ליוויצקי, מ.; פרננדס, ש.; ברטולמי, ר.; באנקה, ה.; Schmidhuber, J. מערכת קונקציוניסטית חדשה לזיהוי כתב יד בלתי מוגבל. IEEE טרנס. דפוס אנאלי. מאך. אינטל. 2009, 31, 855–868. [CrossRef]

44. גואו, ד.; ג'ואו, ו.; לי, ה.; Wang, M. LSTM היררכי לתרגום שפת סימנים. בהליכי ועידת AAAI בנושא בינה מלאכותית, ניו אורלינס, לוס אנג'לס, ארה"ב, 2-7 בפברואר 2018; עמ' 6845–6852.

45. רחמן, מ"מ; Watanobe, Y.; Nakamura, K. מודל שפה דו-כיווני LSTM להערכת קוד ותיקון. Symmetry 2021, 13, 247. [CrossRef]

46. ​​הו, ו.; קאי, מ.; חן, ק.; דינג, ח; שמש, ל.; ליאנג, ס.; מו, X.; Huo, Q. אימון מפלה ברצף לזיהוי כתב יד לא מקוון על ידי פונקציית אינטרפולציה של CTC ו-MMI ללא סריג. בהליכי הוועידה הבינלאומית לניתוח וזיהוי מסמכים, ICDAR, קיוטו, יפן, 9–15 בנובמבר 2017; כרך 1, עמ' 61–66.

47. יושימורה, ט.; חיישי, ט.; Takeda, K.; Watanabe, S. זיהוי דיבור אוטומטי מקצה לקצה משולב עם זיהוי פעילות קולית מבוסס CTC. בהליכי ICASSP, כנס בינלאומי של IEEE בנושא אקוסטיקה, דיבור ועיבוד אותות, ברצלונה, ספרד, 4-8 במאי 2020; עמ' 6999–7003.

48. גואו, ד.; וואנג, ס.; טיאן, ש.; Wang, M. Dense Temporal Convolution Network לתרגום שפת הסימנים. בהליכי הכנס הבינלאומי העשרים ושמונה בנושא בינה מלאכותית (IJCAI-19), מקאו, סין, 10-16 באוגוסט 2017; עמ' 744–750.

49. וואנג, ש.; גואו, ד.; ג'ואו, ו.; ז'א, ז'; Wang, M. Connectionist Temporal Fusion לתרגום שפת הסימנים. בהליכי הכנס הבינלאומי ה-26 של ACM בנושא מולטימדיה, סיאול, קוריאה, 22–26 באוקטובר 2018; עמ' 1483–1491.

50. יאנג, ז.; Shi, Z. SF-Net: Structured Feature Network for Continuous Language Signs Recognition. arXiv 2019, arXiv:1908.01341.

51. צ'נג, KL; יאנג, ז.; חן, ש; Tai, Y. Fully Convolutional Networks לזיהוי רציף של שפת הסימנים. בהליכי הוועידה האירופית לראיית מחשב, גלזגו, בריטניה, 23-28 באוגוסט 2020; עמ' 697–714.

52. קולר, או.; ניי, ח.; Bowden, R. Deep Hand: איך לאמן CNN על 1 מיליון תמונות יד כאשר הנתונים שלך מתמשכים ומסומנים בצורה חלשה. בהליכי כנס IEEE 2016 בנושא ראייה ממוחשבת וזיהוי דפוסים (CVPR), לאס וגאס, NV, ארה"ב, 27-30 ביוני 2016; עמ' 3793–3802.

53. Slimane, FB ענייני הקשר: תשומת לב עצמית לזיהוי שפת הסימנים. arXiv 2021, arXiv:2101.04632.

54. ניו, ז.; Mak, B. Stochastic Fine Grain Labeling of Multi-state Sign Glosss for Continuous Language Language Recognition. בהליכי הוועידה האירופית לראיית מחשב, גלזגו, בריטניה, 23-28 באוגוסט 2020; עמ' 1–16.

55. Cui, R.; ליו, ה.; Zhang, C. Deep Neural Framework לזיהוי מתמשך של שפת הסימנים על ידי אימון איטרטיבי. IEEE טרנס. מולטימד. 2019, 21, 1880–1891. [CrossRef]

56. פו, י; ג'ואו, ו.; הא.; Li, H. חיזוק זיהוי מתמשך של שפת הסימנים באמצעות הגדלת מודאליות. בהליכי הכנס הבינלאומי ה-28 של ACM בנושא מולטימדיה, סיאטל, WA, ארה"ב, 12-16 באוקטובר 2020; עמ' 1497–1505.

אולי גם תרצה