Paper Review
Search


AIの有害な出力を減らすためのレッド チーミング言語モデル(Red Teaming Language Models to reduce harms)
非暴力的、非倫理的な出力を検証できるデータセット
宋永淑 ソン・ヨンソク/ ML Researcher
harm
Generation
害


Codeを通じてLLMの推論能力を高めることができるのか?
コードを通じた巨大言語モデルの推論能力向上
朴宇明 パク ウミョン / CDO & Head of Research
Prompting
Tuning


[論文レビュー]Super-NaturalInstructions
Super-Natural Instructions(SuperNI)論文・データセットの紹介
朴宇明 / CDO & Head of Research, 宋永淑 / ML Researcher
Instruction
LLM
dataset
Super-NaturalInstructions


自動的に最適なPromptを生成する方法
最適なプロンプト方法論の紹介。
朴宇明 / CDO & Head of Research
Prompting
AutoPrompt
導入
•
LLMは単純なプロンプトだけで多くの課題で優れた能力を発揮するが、完璧ではない。
•
その中でも代表的な問題としては、事実でない内容を事実であるかのように生成するハルシネーション問題、そして社会的に問題の余地がある危険な発言を生成する問題などがある。
•
この記事では、biasが存在する、または問題となる内容をLLMが自ら判断し、抑制することに関する論文について紹介する。
•
参考までに、このようなLLMの「self-correction」あるいは「self-refinement」の問題についてもっと詳しく知りたい場合は、このsurvey論文(Pan et al. (2023)および関連referenceを参考
•
レビュー論文

LLMは自ら回答の危険性を判断できるのか?
超巨大言語モデルの回答の危険性を判断するに関連する論文の紹介
朴宇明 / CDO & Head of Research
Prompting
Alignment
LLM


プロンプティングで事実確認(Fact Verification)
超巨大言語モデルの発話が事実かどうかを確認する方法論に関連する論文の紹介
朴宇明 / CDO & Head of Research, 김덕현 / Head of Development
Prompting
Fact Verification


プロンプティングを通じたLLMの推論能力向上
超巨大言語モデルの推論能力向上のためのプロンプトの方法論
朴宇明 / CDO & Head of Research
Prompting
Tuning
導入
•
Promptingは人間が大規模言語モデル(LLM)を制御し、コミュニケーションする手段である。
•
ユーザーは、欲しい結果を得るために、どうすればうまくPromptingを作成できるかという一般的な方法論に対するニーズは今後も増えると思われる。
•
最近、生成だけでなく、自然言語理解(文の分類、シーケンスラベル付け、質疑応答)課題でプロンプトチューニングがファインチューニングよりも性能が良くなったというレポート(Lifu Tu et al. (2022)やCOT(Jason Wei et al. (2022)などのプロンプト方法論、そしてマルチモーダルでの応用(Andy Zeng et al. (2022)などが発表され始めている。
•
この記事では、プロンプティングを通じてzero-shotのパフォーマンスを向上させる興味深い2つの論文を紹介する。

効果的なプロンプティング(Prompting)方法論の紹介
効果的なプロンプティング(Prompting)方法論の紹介
朴宇明 / CDO & Head of Research
Prompting
Tuning


MTEB上位の方法論
MTEBの上位方法論の紹介
朴宇明 / CDO & Head of Research
MTEB
Embedding
Benchmark


LLMの推論能力を高める : Self Discover
解法を先に設計した後、実際の問題を解く2段階方式で推論能力を向上させます。
박우명 / CDO & Head of Research
LLM
超巨大言語モデル
Reasoning


LLMは自分でエラーを検出し、修正できるのか?
超巨大言語モデルがエラーを検出し、回答を修正できるかどうかについての実験
박우명 / CDO & Head of Researcher
LLM
Self Correction






