287 lines
49 KiB
Plaintext
287 lines
49 KiB
Plaintext
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
|
|
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
|
|
9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 2026-05-25T09:05:49+08:00 Yunzhe Jia Refactor CalrtEngineConfig initialization by removing redundant parameters
|
|
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
|
|
ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 2026-05-20T09:22:40+08:00 Yunzhe Jia Add cal-llm backend profiling support with command-line option
|
|
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
|
|
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
|
|
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
|
|
b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
|
|
81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 2026-05-14T16:06:37+08:00 Yunzhe Jia Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
|
|
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
|
|
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
|
|
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
|
|
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
|
|
465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T09:08:12+08:00 wangbomeng support one calbin
|
|
431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-27T16:52:15+08:00 wangbomeng update calrt_infer
|
|
4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec 2026-04-26T10:56:02+08:00 wangbomeng add calrt-version
|
|
e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 2026-04-26T10:55:48+08:00 wangbomeng add calrt-version
|
|
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
|
|
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
|
|
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
|
|
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
|
|
e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-22T16:29:22+08:00 wangbomeng calrt:add CalcoreRT version print
|
|
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
|
|
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
|
|
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
|
|
0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T15:08:50+08:00 Bomeng Wang rm calculet0.txt
|
|
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
|
|
da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 2026-04-08T16:58:32+08:00 Bomeng Wang calrt: add MapBuf
|
|
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
|
|
5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 2026-04-01T05:57:55+08:00 wangbomeng calrt: add t_incopy and t_outcopy
|
|
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
|
|
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
|
|
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
|
|
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
|
|
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
|
|
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
|
|
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
|
|
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
|
|
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
|
|
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
|
|
d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-12T16:10:28+08:00 Bomeng Wang calrt: comment out dump
|
|
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
|
|
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
|
|
6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-10T06:54:41+08:00 wangbomeng arg: update hf_repo url to https://download.calculet.tech:9443
|
|
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
|
|
e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 2026-03-06T11:47:09+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
|
|
27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-03-06T11:42:45+08:00 Yunzhe Jia adapt to calrt_objs target
|
|
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
|
|
aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b 2026-02-27T01:40:11+08:00 wangbomeng calrt: add bf16_to_fp32
|
|
49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 2026-01-28T09:11:16+08:00 Yunzhe Jia adapt to new calbin test_case
|
|
74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 2026-01-13T14:32:47+08:00 Yunzhe Jia sync with calrt update
|
|
8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d 2025-12-09T14:40:04+08:00 Yunzhe Jia adapt to calrt csr
|
|
e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 2025-11-27T16:58:35+08:00 Yunzhe Jia adapt to calrt
|
|
240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 2025-11-24T12:03:00+08:00 Yunzhe Jia adapt to calrt modification
|
|
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
|
|
8da3c0e200a586f768ada6f38745acb01380174c c22473b580807929fd9e3a3344a48e8cfbe6c88f 2025-10-31T13:50:33+02:00 Georgi Gerganov batch : fix consistency checks for the input positions (#16890)
|
|
c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871)
|
|
13002a08960e51a76c4d696165b5d7638d2f2b99 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 2025-10-31T12:46:31+08:00 l3utterfly ggml-hexagon: respect input size when getting/setting tensor data (#16836)
|
|
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
|
|
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
|
|
4926419c4d74a1cf724e7163d937eb72f36e7b26 6ea37f57391d27736c35cd3c20c1f990b7952b74 2025-10-21T16:43:14+08:00 Aman Gupta ggml: add ggml_can_fuse_subgraph (#16662)
|
|
79068501fac9a74cca7129a8e5a8281b410a853e 0e4a0cf2fae667d3efcf52f2f52398779d986b1d 2025-10-20T14:21:12+02:00 Aleksander Grygier Prevent premature submission on IME input (#16673)
|
|
f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 17304cbcc1dd24de7741cbe57925d58e90a98ac1 2025-10-15T23:05:56+09:00 Sam/Samuel metal: optimise `GGML_OP_SUM` (#16559)
|
|
f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251)
|
|
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
|
|
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
|
|
34fcc5a4ace8c69476ef2ea3857f39a60334acc4 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 2025-10-02T19:43:22+02:00 Piotr Wilkin (ilintar) model : Apertus model implementation (#15852)
|
|
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
|
|
2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 2025-09-30T17:37:58+08:00 Yunzhe Jia adapt to calrt
|
|
f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 2025-09-11T14:13:35+08:00 Yunzhe Jia add calrt mtmd support
|
|
66bb7985c3fcefda7a74aae9f8321f70eb1646c4 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 2025-09-29T09:08:41+02:00 Pascal fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
|
|
2f61c0f5bf8a620ca4c3872408803ab38cfb9613 3ffd0fae473c954bb3e67526b31262048fb508d4 2025-09-29T12:33:12+05:30 Vinkal llama-cli: prevent spurious assistant token (#16202)
|
|
cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038)
|
|
3d4053f77f0f78ee2b791088c02af653ebee42dd dc381aa9a6dc45f00673471d34b8bddd30e77570 2025-09-15T16:28:31-06:00 Jake Karnes CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
|
|
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
|
|
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
|
|
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
|
|
fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798)
|
|
5d804a4938d896f9089687a8b99911cdb43b0b94 d4d8dbe383e8b9600cbe8b42016e3a4529b51219 2025-09-02T01:14:55+02:00 Johannes Gäßler ggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722)
|
|
886b97a5d693550c2da470c091d9d27bf38398f8 111f8d06f0b9169059779a35f655b343242ccbb6 2025-08-25T10:47:16-05:00 Jeff Bolz tests: Generate unique input values for count_equal (#15487)
|
|
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
|
|
5e6229a8409ac786e62cb133d09f1679a9aec13e e2c1bfff5305c661ac53e9d57cb732ff626a2242 2025-08-15T19:50:52+02:00 Daniel Bevenius common : fix double bos, use common_chat_templates for add_bos and add_eos (#15326)
|
|
ff27f80a74bbe5303acd511a6781a1de6d619b3c d3248d9b6557c75d59954c594bb53cf517591e91 2025-08-15T21:11:22+08:00 Aaron Teo ggml: initial IBM zDNN backend (#14975)
|
|
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
|
|
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
|
|
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
|
|
f906275537d14c8fc7c6976d944233771fd6672c a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 2025-08-02T10:12:41+02:00 Johannes Gäßler server: enable token array inputs for OAI API (#15001)
|
|
41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964)
|
|
a118d80233d3bf92569c051346fd2638f87bf202 61550f8231dc0aa478e2f537c5009ede6878ce22 2025-07-30T00:25:05-05:00 Douglas Hanley embeddings: fix extraction of CLS pooling results (#14927)
|
|
d1aa0cc5d13ec3fa553de5d298f9166679e58479 c8ade30036139e32108fee53d8b7164dbfda4bee 2025-07-22T13:33:37+01:00 Ed Addario imatrix: add option to display importance score statistics for a given imatrix file (#12718)
|
|
6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 cd465d823c378853f1f6570eebfb77f69c7e1d39 2025-07-21T19:03:19+02:00 rmatif opencl: add conv2d kernel (#14403)
|
|
021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 d498af3d5a00f96bdd37b534860f03a6d9e98d39 2025-07-18T13:35:32+02:00 Oliver Simons cuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741)
|
|
d9b691081c04ec5fb0daa9d2b979f915c142963d ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0 2025-07-17T09:49:15+03:00 Georgi Gerganov kv-cache : opt mask set input (#14600)
|
|
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
|
|
cb9178f885d1986cc0b12feb26ff426bc8a3556c 4a5686da22057867c23bd4a6be941ddc8c51e585 2025-07-09T23:09:28+02:00 Xuan-Son Nguyen llama : remove llm_graph_input_one (#14603)
|
|
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
|
|
bac8bed248d15419137c5bc7f834582397baaebc b81510a7b78f7c5a6f069c4f3d0e569b9d287913 2025-07-05T07:18:09+03:00 Georgi Gerganov eval-callback : check for empty input (#14539)
|
|
5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126)
|
|
55a1c5a5fdefef808e95aabd3d5563af1068cc80 12a81af45f0dbbab24bd819a15f57c03ceb1be90 2025-07-02T20:34:24+08:00 Aman Gupta CUDA: add softmax broadcast (#14475)
|
|
8846aace4934ad29651ea61b8c7e3f6b0556e3d2 a01047b041aa04aeea351933658433ed004516ab 2025-06-26T19:34:02+02:00 Xuan-Son Nguyen model : gemma3n text-only (#14400)
|
|
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
|
|
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
|
|
72c6bc3f3d0cf3bf160dddf1b803fed52bcbb0a3 defe2158dd5e250b4ef53994057a4ec03131a263 2025-06-23T19:56:19+08:00 Molly Sophia llama : better rwkv chat template and add missing `inputs.use_jinja` setting (#14336)
|
|
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
|
|
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
|
|
b9912ac570de8945ae9383c9ca8291027bf287dd 00ba7726100d7e1941d9f5a06f56a7559945b33c 2025-06-15T09:18:37+03:00 Georgi Gerganov batch : auto-gen positions + verify multi-sequence input (#14177)
|
|
b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add call chain for using calrt::infer
|
|
dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
|
|
056eb74534ffd3efc50a9b854156eb6876a52a44 247e5c6e447707bb4539bdf1913d206088a8fc69 2025-06-09T11:20:06+08:00 Yuanhao Ji CANN: Enable labeler for Ascend NPU (#13914)
|
|
33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add load calbin
|
|
806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T09:45:37+08:00 Yunzhe Jia add calrt demo
|
|
663445b0deb21fb602176da030d4154197a4fca6 7675c555a13c9f473249e59a54db35032ce8e0fc 2025-06-02T10:12:20+01:00 Atharva Dubey sycl: quantize and reorder the input to q8_1 when reorder is enabled (#13826)
|
|
c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
|
|
bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
|
|
4f81b33e324b1669b282eb81104e4a1131be7dce cdf94a18023c92f41808ec874ba577d914674717 2025-05-27T09:40:59+03:00 Georgi Gerganov llama : validate seq id batch input (#13809)
|
|
6f180b915c9ed9ec0c240b5dcd64644988fb5e82 03f582ae8fccecff225c30a2802461b44761e822 2025-05-26T21:10:36+05:30 Akarshan Biswas SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611)
|
|
2d38b6e4004fb1c341723e657fb1e71a4d3fb473 e121edc4324a640be11b7e567edd39b721b0f8e4 2025-05-26T10:20:18+08:00 Bizhao Shi CANN: Add the basic supports of Flash Attention kernel (#13627)
|
|
f5cd27b71da3ac375a04a41643d14fc779a8057b a2d02d5793fd9af7a7224773456501691b95fd02 2025-05-25T01:48:08+01:00 Olivier Chafik `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
|
|
9ecf3e66a38f20e41d221f62f05b17f70d040839 faaaff5f947064d13ef8b98659d81a1384c3e57b 2025-05-23T11:03:47+02:00 Xuan-Son Nguyen server : support audio input (#13714)
|
|
797990c4bca0dca5be295c63e3fb2800dc0a69c2 ab86335760ebb441574eb47f886fa1ee302e2131 2025-05-22T20:42:48+02:00 Xuan-Son Nguyen mtmd : add ultravox audio input (#13623)
|
|
3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
|
|
bf7937112058f2815fc3825a9ff7b536ecafa3bb d590cd4c244e5f260c42c290b83a358b9d86d763 2025-05-13T15:31:12+02:00 Sigbjørn Skjæret scripts : support arbitrary input file formats in compare-llama-bench.py (#13455)
|
|
d590cd4c244e5f260c42c290b83a358b9d86d763 1e2809bc4b5d8db2a9ed12ac872eca832c53f5fd 2025-05-13T07:12:01-06:00 Gabe Goodhart model : Granite MoE shared (#13269)
|
|
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
|
|
8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365)
|
|
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
|
|
e84773ab604fe0d935d03741df003716398dc57b fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 2025-05-02T14:20:27+06:00 Shakil Ahmed mtmd-cli : fix out_of_range when input image path is empty (#13244)
|
|
cdf76586b23c67abd3ca064ee2c084c57ae240bd 7d3af70b089bb349b5d17eb01839224c99ec1952 2025-04-29T16:00:27+02:00 Johannes Gäßler CUDA: fix non-cont. inputs for batched mat mul (#13155)
|
|
43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069)
|
|
d2b2031e5f11b826dcc718138642f147a2009665 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 2025-04-28T14:20:56+02:00 Xuan-Son Nguyen llama : (mrope) allow using normal 1D position for text token (#13138)
|
|
5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
|
|
ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402)
|
|
6408210082cc0a61b992b487be7e2ff2efbb9e36 aff9d107b066c9d464f7ab1324280acfdcebf569 2025-04-18T16:02:55-04:00 Daniel Tang main : Fix Ctrl+D/newline handling (#12951)
|
|
75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088 c772d549264c1be058411312a54049e0dc86a037 2025-04-14T17:53:53+05:30 Akarshan Biswas SYCL: Fix im2col (#12910)
|
|
8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
|
|
1466621e738779eefe1bb672e17dc55d63d166bb 82974011f312057b446c27267105bd7ad3810599 2025-04-07T23:06:44+02:00 Xuan-Son Nguyen llama : Support llama 4 text-only (#12791)
|
|
e04643063b3d240b8c0fdba98677dff6ba346784 dbb3a4739e53226346c772dd72666e68b78dc583 2025-03-20T14:57:43Z Woof Dog webui : Prevent rerendering on textarea input (#12299)
|
|
c522ce4143a2b5c277f1e5f65cd570dbd0626466 081bee8c643b1f6302e9edfe789ce2d5f0be6c77 2025-03-14T10:47:44+02:00 Georgi Gerganov graph : simplify attn input build for unified KV cache (#12381)
|
|
e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b 2048b5913d51beab82dfe29955f9008130b936c0 2025-03-13T12:35:44+02:00 Georgi Gerganov llama : refactor llama_context, llama_kv_cache, llm_build_context (#12181)
|
|
2048b5913d51beab82dfe29955f9008130b936c0 f08f4b3187b691bb08a8884ed39ebaa94e956707 2025-03-13T06:10:05-04:00 Ishaan Gandhi server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
|
|
b58934c1836b5ea51dbacbe899eee125775e77c9 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 2025-02-19T00:01:44+02:00 igardev server : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
|
|
c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846)
|
|
2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
|
|
b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677)
|
|
466ea66f338d63109540dae1df97ccfdbf4cd08f 5f0db9522f347b095f84c3033d6c1c1895402e25 2025-01-25T07:26:01+08:00 jiahao su CANN: Add Ascend CANN build ci (#10217)
|
|
aea8ddd5165d525a449e2fc3839db77a71f4a318 9f7add1cde670ff744b791f5ed6649e86a0c586c 2025-01-20T10:38:32-06:00 Jeff Bolz vulkan: fix coopmat2 validation failures (#11284)
|
|
6390a998bfc63241fde8509022b0768a71bf20bb 44e18ef93995f3040660750b527e5becf85899d0 2025-01-18T18:20:57+08:00 LostRuins Concedo tts : add guide tokens support (#11186)
|
|
44e18ef93995f3040660750b527e5becf85899d0 3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 2025-01-18T02:26:50-06:00 Jeff Bolz vulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281)
|
|
437e05f714cdd67757405221578d3f95f8228b63 ca001f6656c1c3d29ef479b3aa5d669453e63be5 2025-01-13T17:16:39+03:30 ebraminio server : (UI) Support for RTL text as models input or output (#11208)
|
|
1bf839b1e8b9d043306c65eddd9021fe4337733e f7cd13301c2a88f97073fd119072b4cc92c08df1 2025-01-08T18:47:05Z Eric Curtin Enhance user input handling for llama-run (#11138)
|
|
db68c93b57bfdf6da1fbdae81080382d6998cbc9 c31fc8b966817b2f0b277fd28e04a189e388972a 2024-12-19T03:50:12+01:00 Daniel Bevenius ggml : improve inputs log sched_print_assignments (ggml/1053)
|
|
7ae33a616f44ecc081f3dcb589be20962d1d4a92 ebdee9478ca7ba65497b9b96f7457698c6ee5115 2024-12-23T01:09:58+03:00 Billel Mokeddem llama : add Falcon3 support (#10883)
|
|
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
|
|
46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872)
|
|
ce8784bdb153ff7794dde5a50b0ebfa51baa6171 e52522b8694ae73abf12feb18d29168674aa1c1b 2024-12-08T23:04:29+01:00 Xuan Son Nguyen server : fix format_infill (#10724)
|
|
3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691)
|
|
605fa66c509f9f117bd654cf0b9b3ea08bb86e80 b7420131bf8ab3e067bc660439ab1ab18be7edbd 2024-11-28T15:25:24+08:00 leo-pony CANN: Fix SOC_TYPE compile bug (#10519)
|
|
9a4b79bcfa4338b922fa8cf903bd5ac058aaf46f 7066b4cce2898993e943ad6af5d8f1de5840c8e9 2024-11-26T18:08:37+08:00 Shanshan Shen CANN: Improve the Inferencing Performance for Ascend NPU Device (#10454)
|
|
cce5a9007572c6e9fa522296b77571d2e5071357 dc39012cbaf8752fabecaeb60af78ccdd1dfb73b 2024-11-24T18:03:25+02:00 Georgi Gerganov flake.lock: Update (#10470)
|
|
2eb76b2a5e4ea395b971a419c95b473ab6f253e4 9b75f03cd2ec9cc482084049d87a0f08f9f01517 2024-11-18T16:08:20+02:00 Georgi Gerganov flake.lock: Update (#10346)
|
|
bcdb7a23862b61aa307fc462fadfe1e2e653d010 f245cc28d4eb900efad0bc740145f58d713c6e4f 2024-11-16T18:26:54+05:00 MaggotHATE server: (web UI) Add samplers sequence customization (#10255)
|
|
9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242)
|
|
4b3a9212b602be3d4e2e3ca26efd796cef13c55e 505f33274d60676320216b662a97672a76ec600e 2024-11-10T21:45:25+02:00 Georgi Gerganov flake.lock: Update (#10243)
|
|
505f33274d60676320216b662a97672a76ec600e 160687b3ed002eee83a04de83a9cd752f928ced1 2024-11-11T00:42:25+05:00 MaggotHATE server : (web UI) Add back sampler settings (#10239)
|
|
e89213492d3e01705739789733f0f2d250b4c449 8fc393f246c550d2481e53323a47644a94e8d01f 2024-11-09T12:47:50+05:30 amritahs-ibm ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156)
|
|
07028f9d74d895da2ca4a1956624e3f07e04e620 524afeec9dad7d765ce91f5cf30c73703867cb47 2024-10-28T17:41:24+02:00 Georgi Gerganov flake.lock: Update (#10063)
|
|
958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023)
|
|
873279b1592e433c4d9eb5065091cc98473c7bee c8c07d658a6cefc5a50cfdf6be7d726503612303 2024-10-20T00:22:59Z github-actions[bot] flake.lock: Update
|
|
19d900a7565b8f6b0a708836a57d26966cb9efe2 11d47057a51f3d9b9231e6b57d0ca36020c0ee99 2024-10-22T15:31:06+02:00 Daniel Bevenius llama : rename batch to ubatch (#9950)
|
|
bc219750845a59166d79f0d4ee3da1993b369b8a 1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31 2024-10-21T09:37:12+03:00 Georgi Gerganov speculative : fix handling of some input params (#9963)
|
|
92be9f12164f18ce845a5bab60cefa5f7fec6836 edc265661cd707327297b6ec4d83423c43cb50a5 2024-10-13T06:11:26+03:00 Georgi Gerganov flake.lock: Update (#9870)
|
|
6279dac039ddeb6d5ebd125a6274fd3c37a77ba8 d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 2024-10-07T19:35:42+03:00 Georgi Gerganov flake.lock: Update (#9753)
|
|
ace4f4be37abed4801fbd54a94cf38a7ae462416 8277a817f18967581b02b2248989d773e8e99998 2024-09-30T17:48:49+03:00 Georgi Gerganov flake.lock: Update (#9680)
|
|
9a913110cf471a8287ac06c43cbe307d3cf6df99 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 2024-09-28T12:08:43Z nopperl llama : add support for Chameleon (#8543)
|
|
3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438)
|
|
f3979df762b75a2b1c0f622a2cd15d1bc60f037f 1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59 2024-09-23T18:43:40+03:00 Georgi Gerganov flake.lock: Update (#9586)
|
|
722ec1eb51ed53be2ab1ef31c6a1da8261803c71 6026da52d6942b253df835070619775d849d0258 2024-09-20T08:38:10+02:00 Sigbjørn Skjæret perplexity : do not escape input data by default (#9548)
|
|
e6b7801bd189d102d901d3e72035611a25456ef1 e665744317c77fc3483fc5224fe6d586b5166b33 2024-09-12T19:46:43+08:00 Dou Xinpeng cann: Add host buffer type for Ascend NPU (#9406)
|
|
cb9c933eb2a0d2b514556bdcb934b56dfe5d6771 6cd4e034442f71718563e600070c2b6fc389e100 2024-09-11T01:46:59+03:00 Georgi Gerganov flake.lock: Update (#9360)
|
|
d2d3200b385970cb2a4658fd9342a3b1212bdb46 51d964a4efdb0e8d43f5b85a775951185f6b641e 2024-08-09T20:21:56+08:00 Mengqing Cao cann : add Ascend NPU support (whisper/2336)
|
|
faf69d4237c9ae4d7f572b4674d1002463e8acd3 e536426ded3fb4a8cd13626e53508cd92928d6c2 2024-09-08T00:33:13+03:00 Georgi Gerganov llama : sanitize invalid tokens (#9357)
|
|
7605ae7daf31c02211bcfec2f46635ef6ec4b98a 8962422b1c6f9b8b15f5aeaea42600bcc2d44177 2024-09-04T02:36:43+03:00 Georgi Gerganov flake.lock: Update (#9261)
|
|
9c1ba557335c3cab46807e6478eb7d17a63361f1 c6d4cb46559b359d2682cf2a002e7fe01bb7a767 2024-09-02T16:51:01+05:30 Tushar build(nix): Package gguf-py (#5664)
|
|
1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 2024-08-29T07:28:14+03:00 Georgi Gerganov flake.lock: Update (#9162)
|
|
18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 554b049068de24201d19dde2fa83e35389d4585d 2024-08-19T10:10:21+03:00 Radoslav Gerganov rpc : prevent crashes on invalid input (#9040)
|
|
ee2984bdaf10c14d440ad873a049bcc09b786d9b c8ddce85606d9fb6e30745b6e4fe103eecadc73f 2024-08-16T14:06:30+03:30 Farbod Bijary py : fix wrong input type for raw_dtype in ggml to gguf scripts (#8928)
|
|
268c5660062270a2c19a36fc655168aa287aaec2 7e72aa74fd676a093eb9970e761085ec22734c71 2024-07-30T23:35:30+03:00 Someone nix: cuda: rely on propagatedBuildInputs (#8772)
|
|
9f77d899b7b0d56496f679e54b797da6199fed8e 203b7f1531303a060730ec1d1e01920e70302398 2024-07-22T14:32:02+03:00 Ivan Filipov ggml: add support for float16 input tensors in pooling operations (ggml/895)
|
|
bfb4c74981f0a40d757b450b596a9fe4ca983d26 2b1f616b208a4a21c4ee7a7eb85d822ff1d787af 2024-07-27T16:36:44+08:00 wangshuai09 cann: Fix Multi-NPU execution error (#8710)
|
|
1bdd8ae19f50bc6f108fa247e90688e5c60559fc da3913d8f9475b0d4bcbeb4936c724af4eade092 2024-07-17T19:23:50+08:00 hipudding [CANN] Add Ascend NPU backend (#6035)
|
|
aaab2419eaa17ab3aa38f4ba49c7eea406999e99 73cf442e7bc9baca7b3e213b261551812f1676c9 2024-07-14T18:54:02+03:00 Georgi Gerganov flake.lock: Update (#8475)
|
|
6af51c0d96e6268769fc05c98d5b1a5e832c0017 f53226245f421bd01b47cce43a47e791de82c636 2024-07-12T14:48:04+03:00 Georgi Gerganov main : print error on empty input (#8456)
|
|
7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2 a130eccef42b75a84da270411cefeed45c153e30 2024-07-09T01:36:38+03:00 Georgi Gerganov flake.lock: Update (#8342)
|
|
fde13b3bb9f569f07fd8af74696ee48a43d05131 470939d483d1c89b7292f78bac1fd27c42c171ce 2024-07-02T11:09:52-05:00 John Balis feat: cuda implementation for `ggml_conv_transpose_1d` (ggml/854)
|
|
6f63d646c1a06a6e09f721009a2676864ae04e31 51d2ebadbbf365b894f3888361df42dbacb12b7a 2024-07-04T18:38:58+02:00 Daniel Bevenius tokenize : add --show-count (token) option (#8299)
|
|
a27152b602b369e76f85b7cb7b872a321b7218f7 3e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e 2024-07-02T22:56:46+02:00 MistApproach fix: add missing short command line argument -mli for multiline-input (#8261)
|
|
ab3679112d4c49a215a3d31550a7720b202e9015 97877eb10bd8e7f8023420b5b5300bcbdadd62dc 2024-06-27T18:37:29+03:00 Georgi Gerganov flake.lock: Update (#8071)
|
|
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
|
|
10ceba354a3b152ff425e9fa97f9caaef99a46b1 e95beeb1fc4621826ddd616776dbdf717366bf5c 2024-06-10T02:04:50+03:00 Georgi Gerganov flake.lock: Update (#7838)
|
|
1669810d7c2446af8425aa54ff6611bf6f14646c 7c4e5b7eae26581869e782015d9deca947c34997 2024-06-03T00:13:12+03:00 Georgi Gerganov flake.lock: Update (#7686)
|
|
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
|
|
dff451cfa1f297348751ce6b538670e1ae9a7d5b d298382ad977ec89c8de7b57459b9d7965d2c272 2024-05-26T18:54:56+03:00 Georgi Gerganov flake.lock: Update (#7540)
|
|
b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
|
|
d041d2ceaaf50e058622d92921b3e680ffa4e9e7 27891f6db03de6e3fd5941983838c29bef253352 2024-05-24T18:59:06+03:00 Georgi Gerganov flake.lock: Update (#7232)
|
|
1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
|
|
e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389)
|
|
e23b974f4cf9270d05062d446f406e3ff55d9451 854d365abab7194b5013a523f72da19860c3c550 2024-05-19T20:51:03+10:00 Brian labeler.yml: Use settings from ggerganov/llama.cpp [no ci] (#7363)
|
|
22842164bcae3251b81ad9e497a16ef66833cb9e 47345248827f426038098d016ed11975021b4919 2024-05-09T12:56:00+02:00 Sigbjørn Skjæret gguf-py : add special token modification capability (#7166)
|
|
b3a995b416e13ae3123a117a743e11d0ede0ca4c bcdee0daa7c5e8e086b719e5eb4073b00df70e01 2024-05-06T18:36:06+03:00 Georgi Gerganov flake.lock: Update (#7079)
|
|
6e472f58e40cd4acf6023e15c75a2700535c5f0b 4dba7e8114d84241c842b986e008af8b88d1a019 2024-04-28T00:18:27Z github-actions[bot] flake.lock: Update
|
|
e9b4a1bf68c18beff4e33f23ea62c1245b296915 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 2024-04-21T00:17:47Z github-actions[bot] flake.lock: Update
|
|
17e98d4c96a583d420f12046bc92102381dbd28e 1958f7e06ca2d2e3ab5698cc67513ba359144d8e 2024-04-15T17:12:26+08:00 Neo Zhang Jianyu fix mul_mat_id() for new input, make the ut pass (#6682)
|
|
b909236c0bf0b6e872af95df9490492ecec310ac e0717e751e12af13f4eedaae8bbbd608e40d7e54 2024-04-07T21:25:30+03:00 Georgi Gerganov flake.lock: Update (#6517)
|
|
f87f7b898651339fe173ddf016ca826163e899d8 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 2024-04-01T19:05:57+03:00 Georgi Gerganov flake.lock: Update (#6402)
|
|
d39b308eaf0ac91c2e1f432bf66751193a470a56 c87397664964e5a2a21de1877d504b23a2a35332 2024-03-27T19:14:28+01:00 hutli nix: moved blas availability check to package inputs so it is still overridable
|
|
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
|
|
b06c16ef9f81d84da520232c125d4d8a1d273736 1f2fd4e727a707f85d58e0b56075c3e6334d18d8 2024-03-25T18:52:45+01:00 Christian Kögler nix: fix blas support (#6281)
|
|
43139cc528909c3de8c144ed174e09a1f7912a80 2f34b865b62b1d2b5eb8a27885e4de220deeacbd 2024-03-25T17:22:27+02:00 Georgi Gerganov flake.lock: Update (#6266)
|
|
2d15886bb092c3b780c676b5cc57ff3337af9c83 d199ca79f279e84ebe27caafe0aa59c461d88969 2024-03-17T06:37:44Z github-actions[bot] flake.lock: Update
|
|
5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c ac9ee6a4ad740bc1ee484ede43e9f92b5af244c1 2024-03-18T16:33:44+01:00 slaren backend : set max split inputs to GGML_MAX_SRC (#6137)
|
|
2bf8d0f7c4cc1235755ad06961ca761e458c5e55 496bc79bc2b79bfd6124b8687a8dbd6a646e9b06 2024-03-18T11:03:04+01:00 slaren backend : offload large batches to GPU (#6083)
|
|
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
|
|
c78541479cf835dd9eb568ccd9a2083198a7203d 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 2024-03-10T16:43:08+02:00 Georgi Gerganov nix: update flake.lock (#5969)
|
|
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
|
|
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
|
|
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
|
|
fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 9731134296af3a6839cd682e51d9c2109a871de5 2024-03-03T06:11:31+02:00 Georgi Gerganov flake.lock: Update (#5842)
|
|
2774b0c97427ee3ad3e2ee121354d078794e89d9 5f706718566e3a5147916dc381f3b99de0ffad47 2024-02-25T20:41:35+01:00 slaren add google magika inference example (ggml/748)
|
|
c39373398803c669056304090050fe3f44b41bf9 e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 2024-02-25T00:17:11Z github-actions[bot] flake.lock: Update
|
|
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
|
|
580111d42b3b6ad0a390bfb267d6e3077506eb31 88c46cbdac05cebd936511b1d3c74112e721615f 2024-02-21T05:08:22-08:00 postmasters llama : add `gemma` model (#5631)
|
|
c8e0d7efeb7634ecc2e9832e879ab9fca4510e71 8f1be0d42f23016cb6819dbae01126699c4bd9bc 2024-02-18T00:17:07Z github-actions[bot] flake.lock: Update
|
|
97a336507ed9b971d72262bec7e2b8b7016a054a c88c74f967028ae3d5ebade40ae586d20a961abc 2024-02-11T00:17:31Z github-actions[bot] flake.lock: Update
|
|
9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c 5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4 2024-02-04T00:17:24Z github-actions[bot] flake.lock: Update
|
|
a4b07c057a553b1ac253051efc3f040351e2eae1 549a1e6cd5b39fe0dc3d4ea5515c65f17797a31e 2024-01-29T14:00:10+02:00 Georgi Gerganov gguf : add input validation, prevent integer overflows (ggml/709)
|
|
1387ea21178f9f154944013d4dd9764b54c69deb 26d607608d794efa56df3bdb6043a2f94c1d632c 2024-01-24T12:48:14+01:00 slaren llama : pre-allocate input tensors in a separate buffer (#5100)
|
|
942c0107a7301434c0a5e7da46bc4cf2393aa556 b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5 2024-01-21T05:17:27+02:00 Georgi Gerganov flake.lock: Update (#5054)
|
|
c37b3474e61d609d43cccc3bde5d559e80e4f5d1 158f8c9e21302114bac3c646f80ea85b52ffa0bd 2024-01-16T19:13:54+02:00 Georgi Gerganov flake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920)
|
|
6efb8eb30e7025b168f3fda3ff83b9b386428ad6 36e5a08b203542dca53cca4eaf172c5dc4bbc991 2024-01-09T13:46:46-05:00 Austin convert.py : fix vanilla LLaMA model conversion (#4818)
|
|
880e352277fc017df4d5794f0c21c44e1eae2b84 66f35a2f48e1965a13835a523e677223dbf148be 2023-12-21T18:07:34+01:00 howlger py : open merges file as 'utf-8' (#4566)
|
|
52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 e4b76bbe316ee50fb17d9ac29e654c0edf830eba 2023-12-05T15:05:51+05:00 MaggotHATE sampling : custom samplers order (#4285)
|
|
71e3718abdb2771b50c9606d3a7569623a0b0afe 238657db2364cfb728c694470a4a81702afea760 2023-11-01T08:04:02+02:00 Georgi Gerganov llama : refactor graph build code (#3837)
|
|
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
|
|
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
|
|
d3956aea53369455008159cc405ed4c496976692 22c69a27945e7acf9690dd3210d316f22182751c 2023-10-22T20:09:51+02:00 vvhg1 main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
|
|
d1031cf49c3b958b915fd558e23453471c29ac33 8cf19d60dc93809db8e51fedc811595eed9134c5 2023-10-20T21:07:23+03:00 Georgi Gerganov sampling : refactor init to use llama_sampling_params (#3696)
|
|
1a159553f921a9209fed8c714494e57b3649f232 281ef73c258cc1eebec8a64264240432d5878c4b 2023-10-17T17:11:01+02:00 staviq tokenizer : special token handling (#3538)
|
|
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
|
|
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
|
|
80834daecf4b9021770361a6d5e1b9c7a60e6854 a40f2b656fab364ce0aff98dbefe9bd9c3721cc9 2023-09-20T22:48:22+09:00 kang flake : Restore default package's buildInputs (#3262)
|
|
4fe09dfe665c58a753dc9eb638dd4dca1cd35488 80291a1d02a07f7f66666fb576c5b1e75aa48b46 2023-09-16T03:02:13+08:00 Meng Zhang llama : add support for StarCoder model architectures (#3187)
|
|
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
|
|
edd4c1481708fcd788b0e423268304fd26e2b125 1591e2e590762011b43b10a9b6e04f13f98f2aa5 2023-08-27T14:19:19+03:00 Georgi Gerganov llama : more tokenizer fixes (#2810)
|
|
50526f37eba0b28336700890242ff282b949cd83 04f4b1eb10f3e25750ca3e530265ce2841730e6b 2023-08-26T12:53:52-04:00 Cebtenzzre llama : use std::abs in llama_sample_tail_free (#2800)
|
|
b8ad1b66b23f9b2e6e4531e9a62753323036a556 f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 2023-08-23T02:12:12-05:00 Xiao-Yong Jin server : allow json array in prompt or content for direct token input (#2306)
|
|
2d7baaf50f3277e65cf71071f61ea34823d14c30 f3c3b4b1672d860800639c87d3b5d17564692469 2023-08-08T06:44:48-05:00 AustinMroz vim : streaming and more (#2495)
|
|
0c06204fb39aa5560e883e0ae74be9518c57d88e 1fed755b1fb9babb6dbc1b4023e492950cd5a5be 2023-07-25T07:19:11-05:00 Xiao-Yong Jin main : add `--in-prefix-bos` to prefix BOS to user inputs; keep EOS (#2304)
|
|
9cf022a1889e50113fd348dc96b4557fc75a6296 e782c9e735f93ab4767ffc37462c523b73a17ddc 2023-07-21T09:42:21+02:00 Przemysław Pawełczyk make : fix embdinput library and server examples building on MSYS2 (#2235)
|
|
c48c525f8711780f3f7c59bf92f1760f38317218 206e01de117cc65ed8713ac9fdebc57ba4532ec3 2023-07-15T02:40:05+08:00 Shangning Xu examples : fixed path typos in embd-input (#2214)
|
|
5656d10599bd756dc0f17284e418e704200b43f3 1d1630996920f889cdc08de26cebf2415958540e 2023-07-10T11:49:56-04:00 Evan Miller mpi : add support for distributed inference via MPI (#2099)
|
|
7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa b472f3fca558b6335adbd87210ed58cfb5da37cb 2023-07-04T18:33:33-05:00 Nigel Bosch embd-input: Fix input embedding example unsigned int seed (#2105)
|
|
79f634a19d1c32a6cfb1befc21551ee684fced6b 04606a159947566b27810508433e6ca5dbc684ba 2023-07-01T18:46:00+03:00 Georgi Gerganov embd-input : fix returning ptr to temporary
|
|
cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e 9d23589d638dc74577d5ff880e6d4248b795f12e 2023-06-28T23:53:37+08:00 ningshanwutuobang llama : support input embeddings directly (#1910)
|
|
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
|
|
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
|
|
fa84c4b3e80199a5683438f062009c031a06c4fa 12b063f0ecf280e98028e444fc492ee6222cdcdc 2023-06-11T08:19:17-06:00 Kerfuffle Fix issue where interactive mode crashes when input exceeds ctx size (#1789)
|
|
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
|
|
41654efea879bbdf4fd794e13335929d4cf0eb90 56551bc11f46b2716fdf61bb48ac28414889dc0a 2023-05-08T19:45:48-07:00 DannyDaemonic Interface improvements and `--multiline-input` (previously `--author-mode`) (#1040)
|
|
2edbdb0f99336cb41f0995061c7602ed54beb863 20fbf2a2a08d8edefe9b3435fa86f8b2f63f8588 2023-05-04T23:41:12+08:00 44670 main : add --in-suffix option (#1318)
|
|
e2cd5069999181a9e4a22cf420e0491878b3062f 2d099e5193d73f800b646c39e2fad08c1c1f1096 2023-05-02T18:13:26+02:00 Ron Evans main : switch input_noecho to input_echo to remove negation (#979)
|
|
f4d277ae17247ee51129ef1a9ff74d377cc90b1b c9a59b70a54e0bc05777df287feaea3dbe0310c4 2023-04-14T17:19:17+02:00 Tomáš Pazdiora main : alternative instruct mode (Vicuna support, etc.) (#863)
|
|
723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545)
|
|
95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653)
|
|
f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone:
|
|
aaf3b23debc1fe1a06733c8c6468fb84233cc44f f2d1c472946dee2aba9077e8df73346796752b10 2023-04-08T17:49:39+02:00 Tomáš Pazdiora fix for windows utf-8 input (#840)
|
|
7b8dbcb78b2f65c4676e41da215800d65846edd0 4b8efff0e3945090379aa2f897ff125c8f9cdbae 2023-03-28T17:09:55+03:00 anzz1 main.cpp fixes, refactoring (#571)
|
|
33e35b8fe8f09adcac0632e9cece62e1dd629f7d 19726169b379bebc96189673a19b89ab1d307659 2023-03-26T07:25:46+02:00 Harald Fernengel Exit from interactive mode if input stream is bad (#491)
|
|
2f7bf7dd7cd7299874d582f7f34834418abf4057 34ab5268432fd287caa68d60bdd8aef411def3fa 2023-03-25T23:38:11+02:00 anzz1 CMake / CI additions (#497)
|
|
34ab5268432fd287caa68d60bdd8aef411def3fa c2b25b6912662d2637d9c6e6df3a5de931e0d7ce 2023-03-25T22:29:22+02:00 anzz1 (Windows) Set console to UTF-8 on init (#420)
|
|
e899bf54b291e8c84173a0e534a2c262f3f63229 fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c 2023-03-25T14:42:09+02:00 anzz1 bounds checking for input prefix (#492)
|
|
fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c 58e6c9f36f97d0a3e287b97256dc5f6b0e9fb5ae 2023-03-25T14:03:19+02:00 anzz1 feat: '--in-prefix STRING' option (#426)
|
|
04c6f5ed6fafd63601fa06757877ed5ccf9d5991 7a9b6c3a8bdc1cb75fefc826dfaa7331eb63695d 2023-03-24T23:17:58+02:00 Georgi Gerganov Immediately start processing the prompt before user input has been provided (#476)
|
|
2e17dfd80a473099dacc0f41c9146d233c6a5972 20a1a4e09c522a80e2a0db51643d25fa38326065 2023-03-23T15:22:47-05:00 rabidcopy Replace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333)
|
|
305ba6f0e6daa3796aad9dd18053a1945dd4cc58 4122dffff958cd137175b58f1f27c0913528d7ba 2023-03-22T18:16:35+01:00 tjohnman Don't force immediate interactive without `-i` (#354)
|
|
16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301)
|
|
5c19c70ba631a8f5d54feb6634e0eea178911a84 24568371ae0d7caf85164abe4753f36a7dba0288 2023-03-19T13:44:30-06:00 Rickey Bowers Jr fix coloring of last `n_batch` of prompt, and refactor line input (#221) |