Concept

မတူသော မူတစ်ခုပေါ်တွင် တည်ဆောက်ထား။

အသိပညာကို မှန်ကန်သော အဓိပ္ပာယ် တစ်ခုတည်းသို့ သတ်မှတ်၍ မရပါ။ တူညီသော စကားလုံးများသည် မည်သူ ဖတ်သည်ပေါ် မူတည်၍ ကွဲပြားစွာ ကျရောက်သည် — ထို အကွာအဝေးသည် လူနှင့် AI ကြားတွင် ပို၍ပင် ကျယ်ပါသည်။

VATES သည် အသိပညာကို သတ်မှတ်ထားသော အဓိပ္ပာယ် အဖြစ် မဟုတ်ဘဲ၊ ဖတ်ရှုသူ တစ်ဦးစီက ထို ခဏတွင် အသက်သွင်းသော structure အဖြစ် ဆက်ဆံသည်။ ရိုးရာ နည်းလမ်းများက အဓိပ္ပာယ်ကို ကြိုတင် သတ်မှတ်သည့်နေရာတွင်၊ VATES က အဓိပ္ပာယ်ဖွင့်ခြင်းကို ဖတ်ရှုသူထံ ချန်ထားသည်။ ထို မူသည် ၎င်း တည်ဆောက်ထားသော အခြေခံ ဖြစ်သည်။

အဘယ်ကြောင့် ဤသို့ တည်ဆောက်ထားသနည်း

VATES နှင့်၊ language model တစ်ခုသို့ အသိပညာ ပေးသွင်းရန် အသုံးများသော နည်းလမ်း (RAG) ၏ နှိုင်းယှဉ်ချက်။

ရှုထောင့်RAGVATES
ကြားခံ လုပ်ဆောင်မှုEmbedding, vector search, re-rankingတစ်ခုမှ မရှိ — plain text ပေါ်တွင် BM25; top-k ကို model သို့
Update များRe-embed နှင့် re-index လိုအပ်ES တစ်ခု ရေးသည့် ခဏတွင် သက်ရောက်
အဓိပ္ပာယ်Embedding ချိန်တွင် coordinate သို့ ချုံ့ထား၍ သွေဖည်သွားstructure အဖြစ် ထား; observation ချိန်တွင် အဓိပ္ပာယ်ဖွင့်
မှီခိုမှုများVector-database infrastructurestandard database နှင့် file များသာ
မြင်နိုင်မှုဂဏန်း vector များ; အပိုင်းအစတစ်ခုကို အဘယ်ကြောင့် ဆွဲထုတ်ခဲ့သည် မသိနိုင် (black box)structure ဖွဲ့ထားသော plain text; အကြောင်းအရာ မြင်နိုင် (white box)
လည်ပတ်မှုRe-embed, re-index; ဖျက်မှုများ vector များတွင် ကျန်ရှိနေနိုင်လိုင်းကို တိုက်ရိုက် ပြင် သို့မဟုတ် ဖျက်; မျက်စိဖြင့် စစ်ဆေးနိုင်

ကြားခံ လုပ်ဆောင်မှု မရှိ

ပုံမှန် RAG system တစ်ခုသည် pipeline တစ်ခု — embedding, vector search, re-ranking — ကို လည်ပတ်သည်။ VATES တွင် ၎င်းတို့ တစ်ခုမှ မရှိပါ။

မေးခွန်းတစ်ခု ဝင်လာသည်။ ES အားလုံးကို ၎င်းနှင့် တိုက်ဆိုင်စစ်ဆေး၍ BM25 ဖြင့် အမှတ်ပေးသည်။ အမြင့်ဆုံး top-k ကို model သို့ ပေးအပ်သည်။ model က ဖြေသည်။

လမ်းကြောင်း တစ်ခုလုံးမှာ ဤမျှသာ ဖြစ်သည်။ ကြိုတင် ပြင်ဆင်ထားသည်မှာ ES သာ ဖြစ်ပြီး; retrieval အတွက် ကြိုတင် ပြင်ဆင်ထားသည် မရှိပါ။ အမှတ်ပေးခြင်းကို မေးခွန်းတိုင်းအတွက် ပြန်လည် တည်ဆောက်သဖြင့်၊ ထိန်းသိမ်းရန် index မရှိ၊ re-embed လုပ်စရာ မရှိ၊ မည်သည့်နေရာတွင်မျှ သတ်မှတ်ထားသော အဓိပ္ပာယ် သိမ်းဆည်းထားခြင်း မရှိပါ။ Retrieval သည် lexical ဖြစ်ပြီး၊ သင် ဖတ်နိုင်သော plain text ပေါ်တွင် ဖြစ်သည်။ model သည် structure ကို တိုက်ရိုက် observe လုပ်သည် — အဓိပ္ပာယ်သည် မရောက်မီ ဆုံးဖြတ်ထားခြင်း မဟုတ်ဘဲ၊ ဖတ်သည့် ခဏတွင် ပေါ်ပေါက်သည်။

ချက်ချင်း Update

RAG သည် အသိပညာ ပြောင်းသည့်အခါတိုင်း re-embed လုပ်၍ index ကို ပြန်တည်ဆောက်ရသည်။ VATES တွင်၊ ES တစ်ခု ရေးပြီးသည်နှင့် နောက်ထပ် query မှ ထင်ဟပ်သည်။ ပြန်တည်ဆောက်ရန် index မရှိပါ။

Observation ချိန်တွင် အဓိပ္ပာယ်ဖွင့်

Embedding သည် သိမ်းသည့် ခဏတွင် အဓိပ္ပာယ်ကို သတ်မှတ်ထားသော coordinate သို့ ပြားသွားစေသည်။ VATES သည် အဓိပ္ပာယ်ကို ကြိုတင် မသတ်မှတ်ပါ — retrieval ကို query အလိုက် ပြန်လည် စုစည်းပြီး၊ အဓိပ္ပာယ်ဖွင့်ခြင်းကို ဖတ်ရှုသူထံ ချန်ထားသည်။ knowledge base တစ်ခုတည်းမှ၊ တုံ့ပြန်ချက်များသည် မေးခွန်းနှင့်နှင့် ဖတ်ရှုသူ၏ ဘာသာစကားနှင့် လိုက်လျောညီထွေ ဖြစ်သည်။ ထို့ကြောင့် ဂျပန်ဘာသာဖြင့် သိမ်းထားသော အသိပညာက၊ translation data လုံးဝ မထားဘဲ ပြင်သစ်ဘာသာဖြင့် ဖြေနိုင်ခြင်း ဖြစ်သည်။

standard database နှင့် file များသာ

သီးသန့် vector database မရှိ — Pinecone, Weaviate သို့မဟုတ် pgvector မရှိ။ အသိပညာသည် plain structure ဖွဲ့ထားသော text ဖြစ်ပြီး၊ သာမန် database နှင့် file များပေါ်တွင် လည်ပတ်သည်။ GPU မရှိ၊ အသုံးပြုမှုအလိုက် embedding API မရှိ။ ရွေ့လျားသော အစိတ်အပိုင်း နည်းခြင်းသည် cost သက်သာပြီး ချွတ်ယွင်းနိုင်သော အမှတ်များ နည်းစေသည်။

White box

RAG index သည် မည်သူမျှ မဖတ်နိုင်သော ဂဏန်း vector အစုအဝေး ဖြစ်သည်; အပိုင်းအစတစ်ခုကို အဘယ်ကြောင့် ဆွဲထုတ်ခဲ့သည် မပြောနိုင်ပါ။ VATES သည် အသိပညာကို observation ၏ အခြေခံ ဝင်ရိုးများ — ဒြပ်၊ ပမာဏ၊ အရည်အသွေး၊ ဆက်နွယ်မှု စသည် — တစ်လျှောက် plain text အဖြစ် ထားရှိပြီး၊ subject တစ်ခု မကိုက်ညီသည့်အခါ ဝင်ရိုးများ လွတ်လပ်စွာ တိုးချဲ့သည်။ ၎င်းသည် သတ်မှတ်ထားသော schema မဟုတ်ပါ။ မျက်စိဖြင့် ဖတ်နိုင်၊ ရှာဖွေနိုင်သည်။ model သည် syntax ကို မြင်; လူသည် table ကို မြင်သည်။

တိုက်ရိုက် ပြင်/ဖျက်

RAG တွင် ဖျက်မှုတစ်ခုသည် re-embed လုပ်ပြီးနောက်တွင်ပင် vector များတွင် ခြေရာ ကျန်ရှိနိုင်သည်။ VATES တွင် သက်ဆိုင်ရာ လိုင်းကို တိုက်ရိုက် ပြင် သို့မဟုတ် ဖျက်၍ ရလဒ်ကို မျက်စိဖြင့် အတည်ပြုသည် — data ဖျက်ရန် တောင်းဆိုမှုများ၊ မေ့ဖျောက်ခံပိုင်ခွင့် (right to be forgotten) ကိုလည်း ဖြည့်ဆည်းပေးသော structure။

ES ဆိုသည်မှာ

ES = EchoScript

VATES က အသိပညာ ကိုင်ဆောင်သော ယူနစ်။ column နှစ်ခု၊ row n ခု၊ pipe (|) ဖြင့် ပိုင်းခြား။ pipe ကိုယ်တိုင်က အဓိပ္ပာယ် မသယ်ဆောင်ပါ; နယ်နိမိတ်တစ်ခုကိုသာ မှတ်သားသည်။ အဓိပ္ပာယ်သည် သင်္ကေတတွင် မဟုတ်ဘဲ၊ ၎င်းကို observe လုပ်သူတွင် ပေါ်ပေါက်သည်။

IIIS = Inter-Intelligence Intermediary Syntax

ES သည် inter-intelligence intermediary syntax (IIIS) အဖြစ် ဒီဇိုင်းထုတ်ထားသော syntactic structure တစ်ခုလည်း ဖြစ်သည်။

အတွင်းတွင် မည်သည် ဝင်သနည်း

မည်သည့် သဘာဝဘာသာစကားမဆို၊ အပြင် ယုတ္တိ သင်္ကေတ နှင့် အခြားများ။ စကားလုံးများ သို့မဟုတ် ဝါကျများ အတူတူ။

IIIS ဆိုသည်မှာ

habitable zone

perception မတူသော ဉာဏ်ရည်များက တူညီသော structure ကို observe လုပ်နိုင်သော syntax တစ်ခု — ၎င်းတို့၏ perception များ ထပ်နေသော habitable zone အတွင်း၌။ ၎င်းသည် IIIS ဖြစ်သည်။

ဉာဏ်ရည်များကြား

ယခုအတွက်: AI နှင့် လူ။

Perception များ ဖြတ်ကျော် observation

တူညီသော ES ကို AI က json အဖြစ်၊ လူက column နှစ်ခု table အဖြစ် ဖတ်သည်။ နှစ်ဦးစလုံး တစ်ခုတည်းသော structure — column နှစ်ခု၊ row n ခု၊ pipe ဖြင့် ပိုင်းခြား၍ ကိုယ်ပိုင် အဓိပ္ပာယ် မသယ်ဆောင် — ကို၊ တစ်ဦးစီ၏ ကိုယ်ပိုင် perception မှတစ်ဆင့် observe လုပ်ကြသည်။

ဤအရာ မည်သည့်နေရာမှ လာသနည်း