Hands-on
Search

CUDA Cã¬ãã«ã§éåœèªã𿥿¬èªã®ããŒã¯ãã€ã¶ãŒãå®è£
ããã
éåœèªã𿥿¬èªã®ããŒã¯ãã€ã¶ãŒãå®è£
é«é«è³¢ / CEO
OOV
CUDA
Tokenizer

LLM Compile Process Overview
ååã®èšäºããæ¥µããŠãã©ã€ããŒããªèªåã ãã®LLMã䟡å€ãããã®ãïŒ[第1å - ãã¡ã€ã³ãã¥ãŒãã³ã°](https://blog.sionic.ai/Finetuning_Llama)ã§ã¯ãå€§èŠæš¡ã¢ãã«æ§ç¯ã®é£ãããšç Žå£çãªå¿åŽçŸè±¡ãªã©ã®ä»£æ¿ãšããŠç»å ŽããRetriever Augmented Generation(RAG)æ¹æ³ãèŠãŠã¿ãŸããã RAGã¯LLMã®åŒ·åãªããã¹ãçæèœåãããŒã¹ã«ããŠãã¢ãã«ã«ãŠãŒã¶ãŒã®ã¯ãšãªã«åã£ãææžã®ã¹ãããããé©åã«åã蟌ãã§ããã³ãããéããŠå¿çããæ¹åŒã§ãããŠãŒã¶ãŒãããŒãœãã©ã€ãºãããLLMãæ§ç¯ããç¹å®ã®ç®çã«åãããŠèª¿æŽããæ¹æ³ã¯ãæ§ã
ãªæã§æçšã«äœ¿çšããããšãã§ããŸãã
ä»åã¯MLC-LLMããã±ãŒãžã掻çšããWebGPU Build & Runã¬ã€ããå
±æããŸããããã«ãããå€§èŠæš¡èšèªã¢ãã«(LLM)ãWebGPUãæŽ»çšããŠããã«ãïŒå®è¡ããéçšãéããŠãèªåã®ããŒã¿ã§å€§èŠæš¡èšèªã¢ãã«ãæ§ç¯ãå®è¡ããããšãã§ããããã«ãªããŸãã
åææ¡ä»¶
LLMãã«ãã®ããã®èŠä»¶
極ããŠãã©ã€ããŒããªç§ã ãã®LLMãäœããã®ãïŒ[第ïŒåŒŸ- WebGPU Build & Run
å人ã®äœ¿ãæ¹ã«åãããè¶
巚倧èšèªã¢ãã«ã®æŽ»çš
é執顯 ãã ããã¯ãã§ã³ / Head of Development
LLM
compilation
WebGPU
RAG(Retrieval Augmented Generation)ãšãã¡ã€ã³ãã¥ãŒãã³ã°
å€§èŠæš¡èšèªã¢ãã«(Large language model, LLM)ã¯ãäžè¬çãªèª²é¡ãããŸãåŠçããå©ç¹ããããŸããç§ãã¡ãChatGPTã«ç±çããçç±ããäžè¬çãªç¥èã«é¢ãã質åãæšè«ã«å¯ŸããŠå¿
èŠãªçããããŸãçæããããã ãšæããŸããããããæ¥åžžçæŽ»ã§ã®å€§èŠæš¡èšèªã¢ãã«ã®æå¹æŽ»çšã«ã¯ãå人ãçµç¹ã¬ãã«ã§ç¹å®ã®ããŒã¿ãåŠç¿ãããããšãäžå¯æ¬ ã§ãã
æ¬çš¿ã§ã¯ãRAGãšãã¡ã€ã³ãã¥ãŒãã³ã°ãšãã2ã€ã®æ¹æ³ãåãäžããŸãããããã¯ãããããå€§èŠæš¡èšèªã¢ãã«ãããŒã¹ã«ããŠã«ã¹ã¿ãã€ãºãè¡ãææ³ã§ãããããããã«ã³ã¹ããšæ§èœã®é¢ã§ç°ãªãç¹åŸŽããããŸãã
ãŸããèšèªã¢ãã«ããã©ã€ããŒããªLLMãšããŠäœ¿çšã§ããæ¹æ³ãšããŠããã¡ã€ã³ãã¥ãŒãã³ã°ããããŸããäºååŠç¿ãããå€§èŠæš¡èšèªã¢ãã«ã«å°ããªããŒã¿ã»ããã远å ã§åŠç¿ãããç¹å®ã®äœæ¥ã«åãããŠåŸ®èª¿æŽããŠæ§èœãæ¹åããæ¹æ³ã§ããäŒçµ±çã«ããã¡ã€ã³ãã¥ãŒãã³ã°ã¯å·šå€§ãªåäœã®ãŠã§ãããŒã¿ãäºååŠç¿ããå°ããªåéã®èª²é¡ã«å¿ããŠãã¥ãŒãã³ã°ãè¡ãæ¹æ³ã§ããããã¢ãã«ã®ãã©ã¡ãŒã¿æ°ãã©ãã©ã倧ãããªããäŒæ¥ãç ç©¶è
ãã¢ãã«å
šäœããã¡ã€ã³ãã¥ãŒãã³ã°ããããšãé£ãããªãããã¡ã€ã³ãã¥ãŒãã³ã°ããã¢ãã«ã®ä¿åãšã³ã¹ããéåžžã«å€§ãããªããŸããããã®ä»ã«ããæ°ããæ
å ±ãåŠç¿ããéã以åã«åŠç¿ããæ
å ±ãçªç¶æ¥æ¿ã«å¿ããçŸè±¡ãã€ãŸãç Žå£çå¿åŽ(Catastrophic forgetting)ãšåŒã°ããçŸè±¡ã解決ã«å°é£ããããŸããã
ChatGPTãªã©ã®LLMã¢ãã«ãç£æ¥çã«å°é ãå§ããŠããã¡ããã©1幎ãçµã¡ãåäŒæ¥ãèŠã€ããè²»çšå¯Ÿå¹æã®é«ãä»£æ¿ææ®µãRAGãšèšããŸããRAGææ³ã¯ãLLMã®åŒ·åãªããã¹ãçæåãããŒã¹ã«ããŠãŒã¶ãŒã®ã¯ãšãªã«åã£ãå¿
èŠãªææžã¹ãããããé©åã«åãåºããã¢ãã«ã«ããã³ãããæäŸããŠå¿çããæ¹æ³ã§ããLlamaIndexãLangchainã®ãããªéçºè
ããŒã«ãunstructured.ioã®ãããªååŠçSDKããããŠMilvusã®ãããªè€æ°ã®åçšã®ãã¯ã¿ãŒãµãŒãDBãæè¿1幎éã«èªèŽããæè³é¡ãšããªã¥ãšãŒã·ã§ã³ãèŠããšãæ¥çã«ãããRAGã«å¯Ÿããé¢å¿åºŠã¯å®¹æã«æšæž¬ã§ãããšæããŸãã

åçåºå
ž: OpenAI - A Survey of Techniques for Maximizing LLM Performance https://youtu.be/ahnGLM-RC1Y
極ããŠç§çãªç§ã ãã®LLMãäœããã®ã? [第ïŒåŒŸãŒãã¡ã€ã³ãã¥ãŒãã³ã°]
éæŽåçãéå«ççãªåºåãæ€èšŒã§ããããŒã¿ã»ãã
æŽ ãžã³ãã§ã³(Sigrid Jin) / Software Engineer, Sionic AI
Finetuning
Llama
ãã¡ã€ã³ãã¥ãŒãã³ã°
å€§èŠæš¡èšèªã¢ãã«
LLM
Databaseæ§ç¯

(ç»ååºå
ž) Microsoft Designer - Stunning designs in a flash ã䜿çšããŠèªåçæåŸç·šé
ãã³ãºãªã³ã®ç°å¢æ§æ
qdrant DB
milvus DB
Vector Databaseæ§ç¯ã®ãã³ãºãªã³
Vector Databaseæ§ç¯å®ç¿
å®ææ²³ / MLOps Engineer
Vector Database
NLP
Generative AIã®ããã®æè¿ã®æè¡åå
WebAssemblyãWebGPUãªã©ããã¬ã³ãã£ãªæè¡ã«ã€ããŠã®è©±

WebGPU
â¢
WebAssemblyãªã©æ¯èŒçæè¿äœ¿ããå§ããJavaScriptã®ä»£æ¿åã§ã¯ãªãè£å®æãšããŠæ©èœ
â¢
GPGPUããŒã¹ã®æ±çšæŒç®å éã匷ã¿
WebGPUã«ãããã©ã€ããŒãçæAIã®Hybrid Inference
WebGPUã«ããããŒãœãã©ã€ãºçæäººå·¥ç¥èœã®æšè«æ¹æ³è«ã®ç޹ä»
é«é«è³¢ / CEO
WebGPU
AI
Hybrid Inference
