0%

非洲对人工智能的愿景

非洲式人工智能(AI)的独特面貌

与硅谷动辄数万亿参数、极度依赖英语和强大算力的巨型模型不同,非洲的AI正在走一条截然不同的道路:它需要精通非洲本土语言、支持语音交互,且足够“轻量”,以便在芯片匮乏和网络不稳定的环境中顺畅运行。

数据缺失与大模型的“失灵”

虽然微软和 OpenAI 的工具在非洲的用户量增长迅速,但主流大语言模型(LLM)在非洲语言上的表现普遍比英语差10到30个百分点。

  • 方言与混杂语(Code-switching):主流模型很难处理日常生活中英语与本土语言交替使用的表达习惯。
  • 数据极度匮乏:在 Common Crawl 数据库中,英语网页有8.72亿页,而阿姆哈拉语(埃塞俄比亚官方语言)仅有8万页。除斯瓦希里语外,绝大多数非洲语言的训练数据甚至少于威尔士语。对于一些小语种,模型甚至只能依靠圣经译本进行训练。

本土初创企业的突围之路

为了打破这一困局,非洲本土的研究者和初创企业正在通过以下方式进行突围:

  • 采集高质量语音数据:在谷歌和盖茨基金会的支持下,像卢旺达的 Digital Umuganda 这样的机构正在录制不同年龄、性别和方言的真人语音,以弥补文本数据的不足。
  • 微调开源模型:肯尼亚非政府组织 Jacaranda Health 通过微调 Meta 的 Llama 2 模型,使其能够用斯瓦希里语提供孕产妇健康咨询。
  • 聚焦“小语言模型”(SLM):南非实验室 Lelapa AI 推出了一款仅有4亿参数的模型 InkubaLM(名称源自祖鲁语中的“屎壳郎”,寓意能搬动数倍于自身重量的物体)。

“小即是美”与数据主权

尼日利亚创业公司 EqualyzAI 为该国卡诺州政府定制了本地化模型,帮助官员检索文件和会议记录。这类只有几亿到几十亿参数的小模型可以直接在本地甚至离线运行,不仅极大地降低了算力成本,还保障了敏感数据不流出非洲。正如其联合创始人 Olubayo Adekanmbi 所说:“如果你想要主权,就保持模型的精简。”

在全球AI产业疯狂追求规模和“全知全能”的当下,非洲AI正以“实用、轻量和本土化”的逆向思维,在科技巨头的缝隙中开辟出一条独特的道路。