/ БЛОГ ·

Монгол хэл дээрх SEO ба GEO: AI хайлтад хэрхэн иш татагдах вэ

Хайлт нь 10 холбоосоос AI-ийн нэг хариулт руу шилжиж байна. Монгол хэлний токенжуулалтын татвар, robots.txt, retrieval-д зориулж бичих арга — бидний өөрсдийн хэмжилт дээр үндэслэв.

Товчхондоо: Хайлтын урсгал Google-ийн 10 холбоосоос AI-ийн нэг хариулт руу шилжиж байна. AI хариулт дунджаар 2–7 домэйн иш татдаг — 10 биш. Монгол хэл дээр энэ өрсөлдөөн бүр хатуу, учир нь загваруудын монгол хэл дээрх сургалтын өгөгдөл нимгэн. Энэ нийтлэл нь бидний huuli.tech болон sodura.ai дээр хийсэн ажлаас гарсан практик тэмдэглэл юм.

Сүүлийн жил хагасын хугацаанд бид монгол хэл дээрх агуулгыг хайлтын систем болон AI туслахуудад хэрхэн харагдуулах вэ гэдэг дээр нэлээд цаг зарцууллаа. Заримыг нь зөв хийсэн, заримыг нь буруу. Энд бичсэн зүйлс бол онол биш — бидний өөрсдийн сайт дээр туршиж үзсэн зүйлс.

Эхлээд нэр томьёог тодруулъя, учир нь эдгээрийг хольж хэрэглэх нь их байдаг:

  • SEO (Search Engine Optimization) — Google-ийн үр дүнгийн жагсаалтад эрэмбэлэгдэх.
  • GEO (Generative Engine Optimization) — ChatGPT, Claude, Perplexity, Google AI Overviews зэрэг үүсгэгч системүүдийн хариулт дотор иш татагдах.
  • AEO (Answer Engine Optimization) — GEO-той бараг ижил утгатай; хариулт өгөх давхаргад чиглэсэн.

Ялгаа нь чухал. SEO бол холбоос авах тухай. GEO бол дурдагдах тухай. Хэрэглэгч AI-аас "Монголд хуулийн AI систем хэн хийдэг вэ?" гэж асуухад таны нэр хариулт дотор гарч ирэх үү — энэ бол өөр тоглоом.


1. Монгол хэлний токенжуулалтын "татвар"

Энэ бол монгол хэл дээр ажилладаг хүн бүрийн ойлгох ёстой техникийн бодит байдал бөгөөд ихэнх GEO гарын авлагад огт дурдагддаггүй.

Хэлний загварууд текстийг токен болгон хуваадаг. Англи хэл дээр нэг үг ≈ нэг токен. Монгол хэл дээр тийм биш. Бид үүнийг өөрсдөө хэмжсэн — OpenAI-ийн o200k_base токенжуулагч (GPT-4o / GPT-4.1 гэр бүл) дээр, ижил утгатай монгол–англи өгүүлбэрийн хосууд ашиглан:

ХэлТокен / үгХарьцаа
Англи1.151.0×
Монгол (кирилл)2.782.4×

Өөрөөр хэлбэл, ижил утгыг илэрхийлэхэд монгол хэл дээр 2.4 дахин олон токен зарцуулагдана. Нэг үг хэрхэн хуваагддагийг харвал шалтгаан нь тодорхой болно:

байгууллагуудынхаа →  бай | гуул | лаг | ууд | ын | ха | а     (7 токен)
хэрэглэгчдэдээ    →  х | эрэг | л | эгч | д | эд | ээ          (7 токен)
боловсруулалтын   →  бол | ов | с | руул | алтын               (5 токен)

Монгол хэл бол залгамал хэл — үндэс дээр нөхцөл дараалан наалддаг. Токенжуулагч нь ихэвчлэн англи давамгайлсан корпус дээр сургагдсан тул эдгээр нөхцөлийг утга учиртай нэгж гэж таньдаггүй, зүгээр л үсэг болгон бутлана.

Энэ нь практикт юу гэсэн үг вэ:

  • Контекст цонх хурдан дүүрнэ. RAG систем бүтээж байгаа бол монгол текстийн хэсгүүд (chunks) англиас 2.4 дахин "үнэтэй". Chunk-ийн хэмжээгээ үүнд тохируулж тооцоол.
  • Inference өртөг өснө. Монгол хэл дээрх бүтээгдэхүүний токены зардал англи хэлтэй ижил биш. Үнийн загвараа энэ дээр үндэслэ.
  • Урт, ярианы маягийн бичлэг сул. Утга нягт, богино өгүүлбэр нь токен тутамд илүү мэдээлэл дамжуулна — энэ нь retrieval-д шууд ашигтай.

Харьцуулбал, 25 европ хэл дээр хийсэн судалгаагаар англи хэл 1.23 токен/үг, хамгийн өндөр нь грек ба мальта ~3.1 байсан. Монгол хэл 2.78-аар славян (2.2–2.5) болон урал-балтийн (2.7–3.0) бүлэгтэй ойролцоо, англиас хамаагүй хол зогсож байна.

Дээрх тоог бид өөрсдөө хэмжсэн болохоос эх сурвалжаас хуулаагүй. Судалгаанд монгол хэлний тусгай тоо олдоогүй тул tiktoken ашиглан параллель өгүүлбэр дээр шууд тоолсон. Та өөрөө давтан шалгаж болно.


2. Техникийн суурь: AI crawler-үүдийг хааж болохгүй

Хамгийн түгээмэл алдаа, бас хамгийн амархан засагдах нь энэ. Олон сайт AI бот-уудыг мэдэлгүйгээр хаасан байдаг — ихэвчлэн ямар нэг темплейт эсвэл "хамгаалалт" залгаснаас болж.

Иш татагдахыг хүсэж байвал дараах user-agent-уудыг robots.txt дотор зөвшөөрөх ёстой:

User-agent: GPTBot          # OpenAI — сургалт
User-agent: OAI-SearchBot   # ChatGPT хайлт
User-agent: ClaudeBot       # Anthropic
User-agent: PerplexityBot   # Perplexity
User-agent: Google-Extended # Gemini / AI Overviews
Allow: /

Энд нэг чухал ялгаа бий: GPTBot нь сургалтын өгөгдөл цуглуулдаг бол OAI-SearchBot нь хариулт үүсгэх үед шууд уншдаг. Хэрэв та агуулгаа сургалтад ашиглуулахыг хүсэхгүй ч AI хайлтад харагдахыг хүсэж байвал эхнийхийг нь хааж, хоёр дахийг нь зөвшөөрч болно. Энэ бол бодлогын шийдвэр — техникийн биш.

llms.txt — хэт их найдаж болохгүй

llms.txt нь 2024 оны 9-р сард Answer.AI-ийн Jeremy Howard дэвшүүлсэн санал бөгөөд сайтынхаа бүтцийг markdown хэлбэрээр AI-д тайлбарлах зорилготой. Нэмэх нь амархан, хор хөнөөлгүй.

Гэхдээ бодитойгоор хэлэхэд: томоохон нийлүүлэгчдийн аль нь ч (OpenAI, Anthropic, Google, Meta) үүнийг production дээр ашиглаж байгаагаа албан ёсоор мэдэгдээгүй. Мөн энэ нь зөвшөөрлийн систем биш — crawler-ийн хяналт нь robots.txt-д л үлдэнэ. Хийвэл хий, гэхдээ үүнийг стратеги гэж бүү үзээрэй.

Бүтэцлэгдсэн өгөгдөл (schema.org)

Энэ нь llms.txt-ээс хамаагүй найдвартай өгөөжтэй. Хамгийн хэрэгтэй төрлүүд: Article, Organization, FAQPage, HowTo, BreadcrumbList. Next.js дээр JSON-LD-г шууд серверийн компонент дотор оруулж болно:

export default function Page() {
  const ld = {
    '@context': 'https://schema.org',
    '@type': 'Article',
    headline: 'Гарчиг',
    inLanguage: 'mn-MN',
    datePublished: '2026-07-28',
    author: { '@type': 'Organization', name: 'SoduraAI' },
  };
  return (
    <script
      type="application/ld+json"
      dangerouslySetInnerHTML={{ __html: JSON.stringify(ld) }}
    />
  );
}

inLanguage: 'mn-MN'-г бүү мартаарай. Монгол агуулгыг орос эсвэл болгар гэж андуурах тохиолдол кирилл бичигтэй сайтуудад бодитоор гардаг.


3. Retrieval-д зориулж бичих

Энэ бол GEO-гийн цөм санаа бөгөөд ойлгоход амархан ч хэрэгжүүлэхэд хэцүү:

AI систем таны хуудсыг бүтнээр нь уншдаггүй. Тэр үүнийг хэсэг (passage) болгон хувааж, асуултад хамааралтай хэсгийг нь сугалж авдаг.

Тиймээс зорилго нь "сайн нийтлэл" бичих биш — бие даан утга илэрхийлэх хэсгүүдээс бүрдсэн нийтлэл бичих. Сугалж авсан догол мөр нь эргэн тойрны контекстгүйгээр ойлгомжтой байх ёстой.

Практик дүрмүүд:

  • Гарчиг бүрийн дараа шууд хариул. Дэвсгэр мэдээллийг эхэнд нь бүү тавь. Хариултыг эхэнд, тайлбарыг араас нь.
  • Төлөөний үгээс зайлсхий. "Энэ нь ийм ажилладаг" гэхээсээ "RAG систем ийм ажилладаг" гэж бич. Сугалагдсан хэсэгт "энэ" гэдэг нь юуг зааж байгаа нь алга болно.
  • Тоо, огноо, нэрийг тодорхой бич. Баталгаажуулж болохуйц баримт бүхий хэсэг иш татагдах магадлал өндөр.
  • Хүснэгт, жагсаалт ашигла. Эдгээр нь цэвэрхэн сугалагдана.
  • FAQ хэсэг нэм. Асуулт–хариултын хос нь AI-ийн хувьд бэлэн "citation block".

Монгол хэл дээр нэг нэмэлт зөвлөгөө: нэр томьёог хоёр хэлээр бич. Хүмүүс монголоор "хиймэл оюун ухаан" гэж хайдаг ч мэргэжлийн хүмүүс "AI" гэж хайдаг. Эхний дурдахдаа хоёуланг нь оруул — жишээ нь "хиймэл оюун ухаан (AI)". Энэ нь загварт хоёр нэр томьёог холбож ойлгоход тусална.


4. Хамгийн эвгүй үнэн: өөрийн сайт хангалтгүй

Бидний олж мэдсэн хамгийн чухал зүйл бол энэ, бас хамгийн таагүй нь: AI системүүд брэндийн өөрийн агуулгаас илүү гуравдагч талын эх сурвалжийг иш татдаг.

Semrush-ийн 150,000 гаруй иш татлагад хийсэн шинжилгээгээр хамгийн их иш татагддаг домэйнууд:

ДомэйнИш татлагын эзлэх хувь
Reddit40.1%
Wikipedia26.3%
YouTube23.5%

Perplexity дээр Reddit-ийн эзлэх хувь 46.7%, Google AI Overviews дээр 21% байна. Шалтгаан нь энгийн: загварууд бодит хүмүүсийн бодит туршлагыг илүү үнэлдэг, хэрэглэгчид корпорацийн маркетингийн текстэд итгэхээ больсон.

Мөн брэндийн дурдагдал (mention) нь backlink-ээс 3 дахин илүү хүчтэй AI харагдалттай хамааралтай гэсэн дүн бий. Өөрөөр хэлбэл, хэн нэгэн таны нэрийг холбоосгүйгээр дурдсан нь холбоос тавьснаас илүү үнэ цэнэтэй байж болно.

Монголын нөхцөлд энэ юу гэсэн үг вэ

Энд асуудал үүсдэг. Монголын интернэт яриа Reddit дээр бараг байхгүй — Facebook групп дээр байдаг. Facebook нь crawl хийгддэггүй, индексжүүлэгддэггүй, тиймээс AI-д харагддаггүй. Монголын хамгийн үнэ цэнэтэй мэдлэгийн ихэнх нь AI-ийн хувьд огт оршин байдаггүй.

Бидний хийж үзсэн, ажилласан зүйлс:

  • Википедиа. Монгол хэл дээрх өгүүлэл маш цөөн. Өөрийн салбартаа холбоотой сэдвээр бодит эх сурвалж бүхий өгүүлэл бичих нь өндөр өгөөжтэй. (Өөрийнхөө компанийн тухай биш — тэр нь устгагдана.)
  • Англи хэл дээр давхар бич. Монголын талаарх асуултын ихэнх нь англиар асуугддаг. Монгол агуулгаа англи хувилбартай болгох нь харагдалтыг мэдэгдэхүйц нэмдэг.
  • Техникийн платформууд. GitHub, Hugging Face, arXiv — эдгээр нь идэвхтэй crawl хийгддэг бөгөөд эрх мэдэлтэй гэж тооцогддог. Нээлттэй эх, dataset, judgment нийтлэх нь агуулгын маркетингаас илүү ажилладаг.
  • Салбарын жинхэнэ хэлэлцүүлэг. Спам биш. Тодорхой асуудлыг тайлбарлаж, алхмуудыг дугаарлаж, дүгнэлт өгсөн бичлэг нь retrieval-ийн хувьд төгс "citation block" болдог.

5. Хэрхэн хэмжих вэ

Уламжлалт SEO хэрэгслүүд эдгээрийг хэмждэггүй. Google Search Console танд AI хариулт дотор дурдагдсан эсэхийг хэлж өгөхгүй.

Бидний хэрэглэдэг энгийн арга — үнэтэй хэрэгсэл шаардахгүй:

  1. Асуултын жагсаалт гарга. Танай үйлчлүүлэгч бодитоор асуух 20–30 асуулт, монгол болон англиар.
  2. Сар бүр гараар шалга. ChatGPT, Claude, Perplexity, Google AI Overviews дээр асуугаад дурдагдсан эсэх, зөв дурдагдсан эсэхийг тэмдэглэ.
  3. Хүснэгтэд бүртгэ. Огноо, платформ, асуулт, дурдагдсан эсэх, иш татсан эх сурвалж. Гурван сарын дараа чиг хандлага харагдана.
  4. Referrer шалга. GA4 эсвэл серверийн лог дээр chatgpt.com, perplexity.ai, claude.ai-аас ирсэн урсгалыг тусад нь харах.

Хамгийн чухал нь дурдагдсан эсэх биш, зөв дурдагдсан эсэх. AI танай бүтээгдэхүүнийг буруу тайлбарлаж байвал энэ нь огт дурдагдаагүйгээс дор. Ийм тохиолдолд засах арга нь тухайн буруу ойлголтыг шууд, тодорхой няцаасан агуулга нийтлэх явдал.


Хаанаас эхлэх вэ

Хэрэв та маргааш л ажил эхлэхийг хүсэж байвал энэ дарааллаар:

  1. robots.txt-ээ шалга. AI бот хаагдсан эсэхийг эхлээд засах — энэ бол хамгийн хямд ялалт.
  2. sitemap.xml болон inLanguage: 'mn-MN' бүхий JSON-LD нэм.
  3. Хамгийн чухал 5 хуудсаа дахин бич — гарчиг бүрийн дараа шууд хариулт, төлөөний үггүй.
  4. Гол хуудсуудынхаа англи хувилбарыг гарга.
  5. Асуултын жагсаалтаа гаргаад суурь хэмжилтээ хий.

Энэ бүхнийг нэг долоо хоногт хийж болно. Үр дүн нь 2–3 сарын дараа харагдана — AI системүүд индексээ шинэчлэх хугацаа шаардлагатай.

Бид үүнийг huuli.tech болон энэ сайт дээрээ хийж байна. Хэрэв та монгол хэл дээрх агуулгаа AI хайлтад харагдуулах талаар ярилцахыг хүсвэл eba@sodura.ai руу бичээрэй.


Эх сурвалж

Ижил төстэй зүйл дээр ажиллаж байна уу?

Нэг богино захидал хангалттай — асуудлаа бичээрэй, бид нэг өдрийн дотор хариулна.

Бидэнтэй холбогдох · eba@sodura.ai