전체
Paper Review
Data curation
Hands-on
Development Glossary
Company
Search
目次
1. 課題設定
2. 全体パイプライン概要
3. 学習レシピ①:多様な文書収集
4. 学習レシピ②:合成クエリ生成
5. 学習レシピ③:Hard Negative Mining
comsat-embed公開:日本語検索ベンチマーク1位の埋め込みモデル
유대곤 / AI/ML Researcher
日本語検索ベンチマーク1位の埋め込みモデルの作り方を共有します。
Embedding
MTEB
SoTA
cleanUrl: "/cuda-tokenizer"
floatFirstTOC: left

CUDA Cレベルで韓国語と日本語のトークナイザーを実装する。
高錫賢 / CEO
韓国語と日本語のトークナイザーを実装
OOV
CUDA
Tokenizer

CICEROデータセット
宋永淑 ソン・ヨンソク / ML Researcher
人工知能モデルの常識的思考に関する会話データ
CICERO
Reasoning

LLMの推論能力を高める : Self Discover
박우명 / CDO & Head of Research
解法を先に設計した後、実際の問題を解く2段階方式で推論能力を向上させます。
LLM
超巨大言語モデル
Reasoning

LLMは自分でエラーを検出し、修正できるのか?
박우명 / CDO & Head of Researcher
超巨大言語モデルがエラーを検出し、回答を修正できるかどうかについての実験
LLM
Self Correction

AIの有害な出力を減らすためのレッド チーミング言語モデル(Red Teaming Language Models to reduce harms)
宋永淑 ソン・ヨンソク/ ML Researcher
非暴力的、非倫理的な出力を検証できるデータセット
harm
Generation
害

極めてプライベートな私だけのLLM、作れるのか?[第2弾- WebGPU Build & Run]
金德顯 キム ドクヒョン / Head of Development
個人の使い方に合わせた超巨大言語モデルの活用
LLM
compilation
WebGPU
Did Aristotle Use a Laptop? A Question Answering Benchmark with Implicit Reasoning Strategies
データ概要
概要
多段階の推論質問応答(QA)ベンチマーク
•
暗黙的な質問である「アリストテレスはノートパソコンを使用したか」に答えるために、明示的な質問である「ノートパソコンが発明された時、アリストテレスは生きていたか」に変換する作業が必要ある。そのために、正解を導き出すプロセスを説明するデータの特性を持つ。
•
一、アリストテレスの生年月、二、ノートブックが発明された時期、三、2は1より前に起きたか?のように、正解を導き出すプロセスを明示的に説明するプロセスをデータに含める。
SuperNI × Clova X韓国語翻訳(1): StrategyQA
宋永淑 ソン・ヨンソク / ML Researcher, 朴宇明 パク ウミョン / CDO & Head of Research
StrategyQA論文とデータセット紹介
StrategyQA
LLM
Embedding

Codeを通じてLLMの推論能力を高めることができるのか?
朴宇明 パク ウミョン / CDO & Head of Research
コードを通じた巨大言語モデルの推論能力向上
Prompting
Tuning
導入
•
Promptingは人間が大規模言語モデル(LLM)を制御し、コミュニケーションする手段である。
•
ユーザーは、欲しい結果を得るために、どうすればうまくPromptingを作成できるかという一般的な方法論に対するニーズは今後も増えると思われる。
•
最近、生成だけでなく、自然言語理解(文の分類、シーケンスラベル付け、質疑応答)課題でプロンプトチューニングがファインチューニングよりも性能が良くなったというレポート(Lifu Tu et al. (2022)やCOT(Jason Wei et al. (2022)などのプロンプト方法論、そしてマルチモーダルでの応用(Andy Zeng et al. (2022)などが発表され始めている。
•
この記事では、プロンプティングを通じてzero-shotのパフォーマンスを向上させる興味深い2つの論文を紹介する。
効果的なプロンプティング(Prompting)方法論の紹介
朴宇明 / CDO & Head of Research
効果的なプロンプティング(Prompting)方法論の紹介
Prompting
Tuning

[論文レビュー]Super-NaturalInstructions
朴宇明 / CDO & Head of Research, 宋永淑 / ML Researcher
Super-Natural Instructions(SuperNI)論文・データセットの紹介
Instruction
LLM
dataset
Super-NaturalInstructions
導入
•
LLMは単純なプロンプトだけで多くの課題で優れた能力を発揮するが、完璧ではない。
•
その中でも代表的な問題としては、事実でない内容を事実であるかのように生成するハルシネーション問題、そして社会的に問題の余地がある危険な発言を生成する問題などがある。
•
この記事では、biasが存在する、または問題となる内容をLLMが自ら判断し、抑制することに関する論文について紹介する。
•
参考までに、このようなLLMの「self-correction」あるいは「self-refinement」の問題についてもっと詳しく知りたい場合は、このsurvey論文(Pan et al. (2023)および関連referenceを参考
•
レビュー論文
LLMは自ら回答の危険性を判断できるのか?
朴宇明 / CDO & Head of Research
超巨大言語モデルの回答の危険性を判断するに関連する論文の紹介
Prompting
Alignment
LLM

表データベースの文章生成
宋永淑 ソン・ヨンソク / ML Researcher
表のデータ分析方法論の紹介
Table
Generation

極めて私的な私だけのLLM、作れるのか? [第1弾ーファインチューニング]
朴 ジンヒョン(Sigrid Jin) / Software Engineer, Sionic AI
非暴力的、非倫理的な出力を検証できるデータセット
Finetuning
Llama
ファインチューニング
大規模言語モデル
LLM

Slack 使用ガイド
金慧元 /CPO, 金德顯 / Head of Development
効果的なスラックの使用ガイド
Culture
Slack

Vector Database構築のハンズオン
宋明河 / MLOps Engineer
Vector Database構築実習
Vector Database
NLP

WebGPUによるプライベート生成AIのHybrid Inference
高錫賢 / CEO
WebGPUによるパーソナライズ生成人工知能の推論方法論の紹介
WebGPU
AI
Hybrid Inference

プロンプティングを通じたLLMの推論能力向上
朴宇明 / CDO & Head of Research
超巨大言語モデルの推論能力向上のためのプロンプトの方法論
Prompting
Tuning

韓国語コーパスの構築(1)
宋永淑 ソン・ヨンソク/ ML Researcher
韓国語コーパスの紹介
data
large language model
corpus

プロンプティングで事実確認(Fact Verification)
朴宇明 / CDO & Head of Research, 김덕현 / Head of Development
超巨大言語モデルの発話が事実かどうかを確認する方法論に関連する論文の紹介
Prompting
Fact Verification

自動的に最適なPromptを生成する方法
朴宇明 / CDO & Head of Research
最適なプロンプト方法論の紹介。
Prompting
AutoPrompt

MTEB上位の方法論
朴宇明 / CDO & Head of Research
MTEBの上位方法論の紹介
MTEB
Embedding
Benchmark
