在電影上自制39M小语语注册指南 – Duoia – ブログ投稿
私のモデルハグフェイス倉庫アドレス:
私は 2 日間をノートに費やして、簡単な質問に答えたり、童話を書いたりできる小さな言語モデルを作成しました。名前はDuoGP Tです。役に立ちませんが、機械学習に役立つように書き留めるかもしれません。
コストモデル
これはDuoGPTのコストパラメータです:
- ノートパソコン RTX4060
- 事前トレーニング 3.37 時間
- SFT2.07時間
- 给梁文峰大肥鱼投喂的五坝钱
モデルの結果
DuoGPT の最終的なスタイルは次のようになります。
Q:/s AはBと同じです。 A と B は違いますか?
A: いいえ。
Q: /s ケイトは猫です。 |ケイトとは何ですか?
A: ケイトは猫です。
Q:/t 内気な猫についての話を書いてください。
A: 昔々、キティという名前の内気な猫がいました。キティはとても内気で、他の動物と話すのが好きではありませんでした。ある日、キティは悲しそうな小鳥を見かけました。その鳥は道に迷い、家族を見つけられませんでした。キティはその鳥を助けたかったので、その家族を探すことにしました。
キティと鳥は、鳥の家族を見つけるまで歩き続けました。鳥はとても喜んで、キティの助けに感謝しました。鳥の家族はとても感謝し、キティを抱きしめました。その日以来、キティはそれほど恥ずかしがり屋ではなくなりました。彼はたくさんの新しい友達を作り、とても楽しかったです。この物語の教訓は、たとえ怖がっていても、勇気を出して他の人を助けることができるということです。
Q:/t 次の話を要約してください。 I ウサギは庭で小鳥に会いました。鳥は飛んで歌います。彼らはお互いに挨拶します。するとうさぎは、小さな蜂が花の周りを飛んでいるのに気づきました。彼はまた、空に美しい蝶を見つけました。すべての小動物が庭で遊んでいます。外で遊んだ後、ウサギはお腹が空いています。新鮮な草と甘いニンジンを食べて、きれいな水を飲みましょう。すぐに、大きな尻尾を持つ茶色のリスに出会います。」リスはとても高くジャンプすることができます。ウサギはリスと楽しく遊んだり、ジャンプしたりしています。
A: ウサギは庭で小鳥や蜂と友達になって、庭で遊んだり楽しんだりします。
つまり、このような小さなモデルは非常に多くのことを学習でき、すでに非常に強力です。
アーキテクチャモデル
モデルの実際のパラメータは 38854144 パラメータ、litgpt0.5.13 フレームワーク、コンテキストは 512、アーキテクチャは 11 層の深さ、512 幅、8 ヘッド、cap dim は 64、SwiGLU inter は 1368、RMSNorm を使用、RoPE、バイアスなし、重みバインディングを使用します。
辞書のサイズは 8192 です。実際、この辞書は少し大きく、この童話の場合は 6k でほぼ十分です。大きな単語の 1 つは比較が小さくなり、もう 1 つは重みが高くなりすぎます。小さなモデルは慎重に計算する必要があります。
トレーニング言語
事前トレーニング言語教材の最大の要素は TinyStoriesV2-GPT4-train です。これは GPT4 によって生成された童話のセットです。約 270 の童話 n-Stories、約 44.8 万篇故事、その単語汇量比TS V2 は少し複雑です、合計サイズは 0.92G、これらのデータ セットは gingface で使用できます。ハグ、結合は 7.45 トークン (我の切札計算的)、この形式、litdata 打用 513 トークン用
SFT语料70%のソースはTinyStoriesからのSFTです、画风は「教文字を写す、何か作品的」踿踻的、別の30%のソースはbAbIです、これはおそらくコンテキストの一部を提供するための小さなタスクデータセットであり、それからあなたに1つの質問をします、总共合计一万条
リンクトレーニング
以下はトレーニング前のリンクです。モデルが小さすぎます。トレーニングは過学習です。時間、オプティマイザーは AdamW によって選択され、バッチ サイズは 256、波形曲線も非常にエレガントです。ゆっくりと下降しています。最終的な損失は 1,602、参加者数は 4.96、3 時間かかり、ピーク値は 5.35G です。
SFTは当初TinyStoriesの自带SFTのみを使用していましたが、この結果は何とも言えません。 53B小時間のストーリー情主讲述了:速度が遅すぎる、水平レベルが高くない)、人々は3つのポイントに達し、モデルはいつでもバックアップする必要があると説明されています。
まとめ
小さなモデルは、分词就减分弄などの慎重に計算する必要があります。今は使用しないでください。その後、トレーニング データによってモデルの上限が完全に決定され、独自のシナリオに基づいている必要があります。
(私的モデル抱き顔小小写真画像:)